跳到正文
热点事件持续更新

开发者实测:模型自写测试 77% 误杀正确代码

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026 年 10 月,一名开发者按“写契约、写测试、写代码、跑测试、修复”的流程搭出一条编码 agent 管线,用来检验模型自写测试的可靠性。做法是把模型生成的测试拿去跑已知正确的参考实现:若测试本身没问题,就应当通过。实测结果是,168 个测试套件中有 129 个(约 77%)拒绝了正确答案,也就是模型自写的测试误杀了本来正确的实现。这意味着在“模型写测试、再由测试驱动修复”的闭环里,大量假阳性失败可能把后续的跑测试与修复环节带偏。报道未提及该结果之外的其他复现、回应或改进方案。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. AGI Hunt
    开发者实测编码 agent 管线:模型自写测试 77% 误杀正确代码

    开发者按写契约、写测试、写代码、跑测试、修复的流程搭出一条编码 agent 管线,再把模型生成的测试喂给已知正确的参考实现,168 个测试套件中有 129 个(77%)拒绝了正确答案。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。