热点事件持续更新
汤森路透提出OC-SFT解决LLM评分器顺序依赖
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
汤森路透研究团队针对 LLM 评分器的顺序依赖问题提出 OC-SFT(顺序一致性监督微调)。2026 年 10 月 5 日的报道称,团队发现 nDCG@10 差距在 0.010 以内的 LLM 评分器,重排后保留集重叠度仅 0.66-0.84,即排名质量相近的评分器在决策上并不一致;所有 prompt 层面的干预都未能解决该顺序依赖。OC-SFT 通过惩罚不同顺序下的得分不一致,在三个任务上决策稳定性领先。作者建议比较时报告阈值保留内容与阅读器答案,代码已开源。
AI 根据报道生成 · 1 小时前更新
最新进展10月5日 22:17
报道称所有 prompt 层干预均未解决顺序依赖,OC-SFT 在三个任务上决策稳定性领先。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- AGI Hunt汤森路透研究:排名质量相近的 LLM 评分器决策重排后仅 0.66-0.84 重合
汤森路透团队发现,nDCG@10 差距在 0.010 以内的 LLM 评分器,重排后保留集重叠度仅 0.66-0.84。所有 prompt 层面干预都未能解决该顺序依赖;其顺序一致性 SFT(OC-SFT)惩罚不同顺序下的得分不一致,在三个任务上决策稳定性领先。作者建议比较时报告阈值保留内容与阅读器答案,代码已开源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。