跳到正文
原文
AGI Hunt· xiye_nlp·· 3 小时前AI 评分48

LongHarness 基准:不同智能体框架成本差异巨大,mini-swe 接近直推成本拿下最佳成绩

不同 agent 框架成本差异巨大,mini-swe 接近直推成本拿下最佳成绩

AI 导读

LongHarness 基准发布,用于评测 RLM、编码智能体等长上下文 harness,显示不同智能体框架成本差异巨大,mini-swe 以接近直推的成本拿下最佳成绩。同一模型在不同 harness 下准确率与效率差距可超 10 倍,且更多算力并不总等于更高准确率,相似性能的开销相差极大。

来源:AGI Hunt · agihunt.info