AGI Hunt· jyangballin·· 1 天前AI 评分56
ProgramBench 榜单更新:Claude Opus 5 以 4.5% 完全解决率居首
ProgramBench 榜单:最抢手模型完整重建程序解决率仅 4.5%
AI 导读
由 Meta Superintelligence Labs、斯坦福与哈佛推出的 ProgramBench 基准更新,agent 需依据编译后的二进制文件与文档从零架构并实现完整代码库以复现原程序行为,共 200 个任务,以隐藏行为测试判定是否完全解决。
来源:AGI Hunt · agihunt.info