AGI Hunt· heyitsdannyle·2026-10-06 15:03· 6 小时前AI 评分44SWE-Race 基准发布:188 个真实并发 bug,GPT-5.6 Luna 硬题仅 23%AI 导读团队发布 SWE-Race 编码 agent 基准,任务取自约 100 个 Python 项目已合并 PR 的 188 个真实并发 bug,涵盖竞态、死锁与取消问题,用项目自身测试在无网络容器中评分。来源:AGI Hunt · agihunt.info#评测/基准#Agent#编码#开源/仓库#OpenAI查看事件全部后续