arXiv cs.AI· Mohammadreza Sediqin, Shivali Dalmia, Srinivasa Karthikeya Reddy Kovvuri, Abhishek Mukherji·· 4 小时前AI 评分48
为 AI 智能体评测加一层 Trust Layer:验证基准分数是否可信
A Trust Layer for Agent Evaluation
AI 导读
研究提出 Trust Layer for Agent Evaluation,一个不修改记录分数的事后框架,核查分数是否有基准自身评分逻辑支撑、通过答案是否可追溯计算、完成声明是否与实际一致、重复执行是否稳定——前三项只用已保存产物,第四项需重跑 agent。
来源:arXiv cs.AI · arxiv.org