跳到正文
原文
arXiv cs.AI· Yuyang Cheng, Raghav Kaushik Ravi, Srivarshinee Sridhar, Sriparna Saha, Akash Ghosh, Chirag Agarwal·· 2 天前AI 评分41

MEA:面向忠实模型解释的奖励驱动多智能体系统

MEA: A Reward-Driven Multi-Agent System for Faithful Model Explanations

AI 导读

MEA 是一个奖励驱动的多智能体框架,由 Proposer 智能体按问题与模态选择并配置解释工具,Actor 智能体针对忠实度端到端优化,为表格、文本和视觉模型生成自然语言解释。在六个数据集上,MEA 优于 post hoc 解释器、智能体与闭源基线,忠实度较未训练骨干分别提升 +28%(表格)、+21%(文本)、+34%(视觉)。论文同时发现前沿 LLM 会系统性地给出不忠实的解释。

来源:arXiv cs.AI · arxiv.org