热点事件持续更新
Reddit 质疑 LLM 记忆基准可信度
1 篇报道1 个报道来源10 小时前更新
先了解这件事
AI 综述
2026年10月5日,一位 Reddit 用户发帖指出,同一组答案在测评「记忆能力」时,用 token overlap F1 只得 51.4 分,换成 LLM judge 则为 75.8 分,两者相差超过 24 个百分点。该用户认为,读取记忆的模型、评判答案的模型以及运行次数都会影响结果,但这些信息很少随分数一起公开,且大量数字来自厂商自报。因此他询问社区,该如何判断这类基准分数是否有意义。目前讨论聚焦于 LLM 记忆基准的可信度与透明度。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 15:08
Reddit 用户发现同一组答案换评测方法后记忆分数由 51.4 升至 75.8,公开征询基准可信度判断方法。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI Hunt同一系统测出 51.4 和 75.8,Reddit 质疑 LLM 记忆基准可信度
一位 Reddit 用户指出,同一组答案用 token overlap F1 测评「记忆能力」得 51.4 分,换成 LLM judge 后为 75.8,相差超 24 个百分点。读取记忆的模型、评判答案的模型与运行次数都会影响结果,却很少随分数一起公开,且大量数字来自厂商自报。该用户因此询问社区如何判断这类基准分数是否有意义。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。