跳到正文
原文
arXiv cs.AI· Salma Roshdy Aly, Hussein Assaf, Ziad Kobti·· 2 天前AI 评分39

多智能体代码裁判何时真正有据可依?MARCH 上的两项无标签度量与一个拒绝猜测的裁判

When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess

AI 导读

未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。

来源:arXiv cs.AI · arxiv.org