热点事件持续更新
Applied Compute 评测管线改用决策式评分器
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026 年 10 月 6 日,AGI Hunt 报道,Applied Compute 在其 AC2 的代码 QA benchmark 上,把强化学习(RL)与评测管线中的 LLM judge 替换为决策式评分器:该评分器在一次调用中即可同时为所有 rubric 标准给出 yes/no 概率,而不再逐条调用模型做判断。报道称,这一替换使成本降低约 32 倍,一致率达到 94%。目前该做法是在 AC2 的代码 QA benchmark 上落地,报道未说明是否已推广到其他 benchmark 或产品线。此事件目前仅有这一篇报道,暂无后续进展或与之冲突的说法。
AI 根据报道生成 · 1 小时前更新
最新进展10月6日 23:45
AC2 代码 QA benchmark 弃用 LLM judge,改用决策式评分器,成本降约 32 倍报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- AGI HuntApplied Compute 用决策式评分器替代 LLM judge,成本降约 32 倍、一致率 94%
Applied Compute 在 AC2 的代码 QA benchmark 上把 RL 与评测管线中的 LLM judge 换成决策式评分器,一次调用同时为所有 rubric 标准给出 yes/no 概率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。