跳到正文
原文
AGI Hunt· heyitsdannyle·· 6 小时前AI 评分44

SWE-Race 基准发布:188 个真实并发 bug,GPT-5.6 Luna 硬题仅 23%

AI 导读

团队发布 SWE-Race 编码 agent 基准,任务取自约 100 个 Python 项目已合并 PR 的 188 个真实并发 bug,涵盖竞态、死锁与取消问题,用项目自身测试在无网络容器中评分。

来源:AGI Hunt · agihunt.info