热点事件持续更新
harness 对比评测:120 次运行的隐形成本
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
此前有 Reddit 帖讨论 Agent harness 对比评测的运行规模:20 个任务、3 次重复会得到 120 次运行。2026 年 10 月 2 日,AGI Hunt 进一步说明这类配对 harness 对比评测的隐形成本:20 个任务×3 次重复会产生 120 个 agent episode,且这一数字不包含提出候选修改所消耗的调用。文档标注的运行次数公式为 2 × tasks × episode repeats,对比双方是当前 harness 与候选版本,两者使用同一任务套件、固定模型,运行交错进行。报道强调,120 只是执行次数,并不等于 token 预算,也不代表统计置信度;当任务套件翻倍时,这部分评测工作量也随之翻倍。截至最新报道,未出现相互矛盾的数字或说法。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 21:38
AGI Hunt 说明 120 次只是执行次数,不含候选修改调用,也不等于 token 预算或置信度。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI Hunt20 任务×3 重复=120 次运行:Agent harness 对比评测的隐形成本
在配对 harness 对比评测中,20 个任务、3 次重复会产生 120 个 agent episode,且不含提出候选修改所消耗的调用。文档标注的运行次数为 2 × tasks × episode repeats,对比双方是当前 harness 与候选版本,同一任务套件、固定模型,运行交错进行。120 只是执行次数,不等于 token 预算或统计置信度,任务套件翻倍时这部分评测工作量也翻倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。