跳到正文
原文
AGI Hunt· Efficient_Joke3384·· 11 小时前AI 评分42

同一系统测出 51.4 和 75.8,Reddit 质疑 LLM 记忆基准可信度

同一系统测出 51.4 和 75.8,Reddit 质疑 LLM 记忆基准可信度

AI 导读

一位 Reddit 用户指出,同一组答案用 token overlap F1 测评「记忆能力」得 51.4 分,换成 LLM judge 后为 75.8,相差超 24 个百分点。读取记忆的模型、评判答案的模型与运行次数都会影响结果,却很少随分数一起公开,且大量数字来自厂商自报。该用户因此询问社区如何判断这类基准分数是否有意义。

来源:AGI Hunt · agihunt.info