AGI Hunt· RelationshipRound711·· 3 小时前AI 评分45
20 任务×3 重复=120 次运行:Agent harness 对比评测的隐形成本
20任务×3重复=120次运行:harness对比评测的隐形成本
AI 导读
在配对 harness 对比评测中,20 个任务、3 次重复会产生 120 个 agent episode,且不含提出候选修改所消耗的调用。文档标注的运行次数为 2 × tasks × episode repeats,对比双方是当前 harness 与候选版本,同一任务套件、固定模型,运行交错进行。120 只是执行次数,不等于 token 预算或统计置信度,任务套件翻倍时这部分评测工作量也翻倍。
来源:AGI Hunt · agihunt.info