AGI Hunt· thomsonreuters·· 7 小时前AI 评分48
汤森路透研究:排名质量相近的 LLM 评分器决策重排后仅 0.66-0.84 重合
汤森路透研究:排名质量相近的 LLM 评分器决策重排后仅 0.66-0.84 重合
AI 导读
汤森路透团队发现,nDCG@10 差距在 0.010 以内的 LLM 评分器,重排后保留集重叠度仅 0.66-0.84。所有 prompt 层面干预都未能解决该顺序依赖;其顺序一致性 SFT(OC-SFT)惩罚不同顺序下的得分不一致,在三个任务上决策稳定性领先。作者建议比较时报告阈值保留内容与阅读器答案,代码已开源。
来源:AGI Hunt · agihunt.info