热点事件持续更新
LongHarness 基准发布:agent 框架成本差异巨大
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月1日,AGI Hunt 报道称,LongHarness 基准正式发布,用于评测 RLM、编码智能体等长上下文 harness。测试结果显示,不同智能体框架之间的成本差异巨大:同一模型在不同 harness 下,准确率与效率的差距可超过 10 倍;更多算力并不总等于更高准确率,性能相近的框架之间开销相差极大。其中,mini-swe 以接近直推(direct prompting)的成本拿下最佳成绩。报道未披露参评框架的完整名单、具体分数与成本数值。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- AGI HuntLongHarness 基准:不同智能体框架成本差异巨大,mini-swe 接近直推成本拿下最佳成绩
LongHarness 基准发布,用于评测 RLM、编码智能体等长上下文 harness,显示不同智能体框架成本差异巨大,mini-swe 以接近直推的成本拿下最佳成绩。同一模型在不同 harness 下准确率与效率差距可超 10 倍,且更多算力并不总等于更高准确率,相似性能的开销相差极大。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。