AGI Hunt· najoungkim·2026-10-02 23:45· 3 小时前AI 评分48RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估AI 导读RExBench 评估 LLM agent 能否自主实现 AI 研究论文的扩展,12 个 agent(aider、OpenHands 框架)无一能完成多数扩展,最佳成功率仅约 33%。来源:AGI Hunt · agihunt.info#评测/基准#Agent#编码查看事件全部后续