跳到正文
热点事件持续更新

Reddit 质疑 LLM 记忆基准可信度

1 篇报道1 个报道来源10 小时前更新

先了解这件事

AI 综述

2026年10月5日,一位 Reddit 用户发帖指出,同一组答案在测评「记忆能力」时,用 token overlap F1 只得 51.4 分,换成 LLM judge 则为 75.8 分,两者相差超过 24 个百分点。该用户认为,读取记忆的模型、评判答案的模型以及运行次数都会影响结果,但这些信息很少随分数一起公开,且大量数字来自厂商自报。因此他询问社区,该如何判断这类基准分数是否有意义。目前讨论聚焦于 LLM 记忆基准的可信度与透明度。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    同一系统测出 51.4 和 75.8,Reddit 质疑 LLM 记忆基准可信度

    一位 Reddit 用户指出,同一组答案用 token overlap F1 测评「记忆能力」得 51.4 分,换成 LLM judge 后为 75.8,相差超 24 个百分点。读取记忆的模型、评判答案的模型与运行次数都会影响结果,却很少随分数一起公开,且大量数字来自厂商自报。该用户因此询问社区如何判断这类基准分数是否有意义。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。