跳到正文
热点事件持续更新

汤森路透提出OC-SFT解决LLM评分器顺序依赖

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

汤森路透研究团队针对 LLM 评分器的顺序依赖问题提出 OC-SFT(顺序一致性监督微调)。2026 年 10 月 5 日的报道称,团队发现 nDCG@10 差距在 0.010 以内的 LLM 评分器,重排后保留集重叠度仅 0.66-0.84,即排名质量相近的评分器在决策上并不一致;所有 prompt 层面的干预都未能解决该顺序依赖。OC-SFT 通过惩罚不同顺序下的得分不一致,在三个任务上决策稳定性领先。作者建议比较时报告阈值保留内容与阅读器答案,代码已开源。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    汤森路透研究:排名质量相近的 LLM 评分器决策重排后仅 0.66-0.84 重合

    汤森路透团队发现,nDCG@10 差距在 0.010 以内的 LLM 评分器,重排后保留集重叠度仅 0.66-0.84。所有 prompt 层面干预都未能解决该顺序依赖;其顺序一致性 SFT(OC-SFT)惩罚不同顺序下的得分不一致,在三个任务上决策稳定性领先。作者建议比较时报告阈值保留内容与阅读器答案,代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。