热点事件持续更新
RExBench:编码Agent研究扩展成功率仅33%
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
RExBench 是一个用于评估 LLM agent 能否自主实现 AI 研究论文扩展的基准测试。2026 年 10 月 2 日的报道显示,在该基准的测试中,12 个基于 aider、OpenHands 等框架的编码 agent 均未能完成大多数研究扩展任务,表现最好的 agent 成功率也仅约 33%。报道同时提到,该团队正在招募人类在环(human-in-the-loop)评估,以进一步考察相关能力。目前尚无关于具体任务设定、评测规模或后续版本的更多信息。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 23:45
RExBench 测试中 12 个编码 agent 最佳仅约33%成功率,团队正招募人类在环评估。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntRExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估
RExBench 评估 LLM agent 能否自主实现 AI 研究论文的扩展,12 个 agent(aider、OpenHands 框架)无一能完成多数扩展,最佳成功率仅约 33%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。