跳到正文
热点事件持续更新

LongHarness 基准发布:agent 框架成本差异巨大

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月1日,AGI Hunt 报道称,LongHarness 基准正式发布,用于评测 RLM、编码智能体等长上下文 harness。测试结果显示,不同智能体框架之间的成本差异巨大:同一模型在不同 harness 下,准确率与效率的差距可超过 10 倍;更多算力并不总等于更高准确率,性能相近的框架之间开销相差极大。其中,mini-swe 以接近直推(direct prompting)的成本拿下最佳成绩。报道未披露参评框架的完整名单、具体分数与成本数值。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    LongHarness 基准:不同智能体框架成本差异巨大,mini-swe 接近直推成本拿下最佳成绩

    LongHarness 基准发布,用于评测 RLM、编码智能体等长上下文 harness,显示不同智能体框架成本差异巨大,mini-swe 以接近直推的成本拿下最佳成绩。同一模型在不同 harness 下准确率与效率差距可超 10 倍,且更多算力并不总等于更高准确率,相似性能的开销相差极大。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。