AGI Hunt· deadatreides1·2026-10-05 03:32· 5 小时前AI 评分57开发者实测编码 agent 管线:模型自写测试 77% 误杀正确代码模型自己写的测试 77% 概率误杀正确代码,实测揭示 agent 管线隐坑AI 导读开发者按写契约、写测试、写代码、跑测试、修复的流程搭出一条编码 agent 管线,再把模型生成的测试喂给已知正确的参考实现,168 个测试套件中有 129 个(77%)拒绝了正确答案。来源:AGI Hunt · agihunt.info#评测/基准#编码#Agent查看事件全部后续