跳到正文
原文
arXiv cs.AI· Mohammadreza Sediqin, Shivali Dalmia, Srinivasa Karthikeya Reddy Kovvuri, Abhishek Mukherji·· 4 小时前AI 评分48

为 AI 智能体评测加一层 Trust Layer:验证基准分数是否可信

A Trust Layer for Agent Evaluation

AI 导读

研究提出 Trust Layer for Agent Evaluation,一个不修改记录分数的事后框架,核查分数是否有基准自身评分逻辑支撑、通过答案是否可追溯计算、完成声明是否与实际一致、重复执行是否稳定——前三项只用已保存产物,第四项需重跑 agent。

来源:arXiv cs.AI · arxiv.org