跳到正文
原文
AGI Hunt· deadatreides1·· 5 小时前AI 评分57

开发者实测编码 agent 管线:模型自写测试 77% 误杀正确代码

模型自己写的测试 77% 概率误杀正确代码,实测揭示 agent 管线隐坑

AI 导读

开发者按写契约、写测试、写代码、跑测试、修复的流程搭出一条编码 agent 管线,再把模型生成的测试喂给已知正确的参考实现,168 个测试套件中有 129 个(77%)拒绝了正确答案。

来源:AGI Hunt · agihunt.info