跳到正文
原文
arXiv cs.CL· Mukul Chhabra, Shail Patel, Luigi Medrano·· 2 天前AI 评分34

CARGO:面向生产环境智能体 AI 的上下文感知检索门控评估

CARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production

AI 导读

CARGO 框架将检索到的参考当作流程范例、以实例观测上下文锚定事实判断、并按检索置信度门控,用于生产环境的智能体 AI 评估。在 246 条样本、7,872 次判断的 CARGO-Bench 上,参考式 judge 会惩罚 100% 的正确实体替换答案且 DI 约为 0,CARGO 将误判降至 0/50、矛盾召回保持 50/50,DI 升至 0.58;但其宽松设计对流程性错误的召回仅 20%。

来源:arXiv cs.CL · arxiv.org