跳到正文
热点事件持续更新

Applied Compute 评测管线改用决策式评分器

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 6 日,AGI Hunt 报道,Applied Compute 在其 AC2 的代码 QA benchmark 上,把强化学习(RL)与评测管线中的 LLM judge 替换为决策式评分器:该评分器在一次调用中即可同时为所有 rubric 标准给出 yes/no 概率,而不再逐条调用模型做判断。报道称,这一替换使成本降低约 32 倍,一致率达到 94%。目前该做法是在 AC2 的代码 QA benchmark 上落地,报道未说明是否已推广到其他 benchmark 或产品线。此事件目前仅有这一篇报道,暂无后续进展或与之冲突的说法。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    Applied Compute 用决策式评分器替代 LLM judge,成本降约 32 倍、一致率 94%

    Applied Compute 在 AC2 的代码 QA benchmark 上把 RL 与评测管线中的 LLM judge 换成决策式评分器,一次调用同时为所有 rubric 标准给出 yes/no 概率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。