热点事件持续更新
Benzi 发布编译器驱动编码 agent,称 SWE-bench 78.2%
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月2日,据 AGI Hunt 报道,开发者发布编译器驱动的 AI 编码 agent Benzi,声称其 SWE-bench Verified 得分达 78.2%,胜过 Claude Code,且单次修复成本不到 10 美分。报道称该 agent 不阅读源码,而是通过工具调用让编译器直接告知改动影响范围并做静态检查;完成同样任务只读取 9,125 行代码,而 Claude Code Sonnet 为 20,704 行、DeepSeek harness 为 43,598 行。上述分数、对比与成本数据均来自开发者自述,报道未提及第三方独立验证或复现结果。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 05:36
开发者称 Benzi 在 SWE-bench Verified 达 78.2%,单次修复成本不到 10 美分。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI Hunt编译器驱动的 AI 编码 agent Benzi:声称胜过 Claude Code,SWE-bench 78.2%、单次修复不到 1 毛钱
开发者发布编译器驱动的 AI 编码 agent Benzi,声称 SWE-bench Verified 达 78.2%、单次修复成本不到 10 美分。它不读源码,靠工具调用让编译器直接告知改动影响范围并做静态检查;同样任务只读 9,125 行代码,Claude Code Sonnet 为 20,704 行、DeepSeek harness 为 43,598 行。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。