跳到正文
热点事件持续更新

RExBench:编码Agent研究扩展成功率仅33%

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

RExBench 是一个用于评估 LLM agent 能否自主实现 AI 研究论文扩展的基准测试。2026 年 10 月 2 日的报道显示,在该基准的测试中,12 个基于 aider、OpenHands 等框架的编码 agent 均未能完成大多数研究扩展任务,表现最好的 agent 成功率也仅约 33%。报道同时提到,该团队正在招募人类在环(human-in-the-loop)评估,以进一步考察相关能力。目前尚无关于具体任务设定、评测规模或后续版本的更多信息。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估

    RExBench 评估 LLM agent 能否自主实现 AI 研究论文的扩展,12 个 agent(aider、OpenHands 框架)无一能完成多数扩展,最佳成功率仅约 33%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。