跳到正文
原文
AGI Hunt· najoungkim·· 3 小时前AI 评分48

RExBench 显示编码 agent 自主完成研究扩展成功率仅 33%,团队招募人类在环评估

AI 导读

RExBench 评估 LLM agent 能否自主实现 AI 研究论文的扩展,12 个 agent(aider、OpenHands 框架)无一能完成多数扩展,最佳成功率仅约 33%。

来源:AGI Hunt · agihunt.info