跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.02480·本站收录 · 原文发表

MEA:面向忠实模型解释的奖励驱动多智能体系统

MEA: A Reward-Driven Multi-Agent System for Faithful Model Explanations

AI 导读

研究者提出 MEA 多智能体框架,用 Proposer agent 按问题和模态选择并配置解释工具,再用 Actor agent 针对忠实度端到端优化,把输出转成基于模型行为的自然语言解释,覆盖表格、文本和视觉三种模态。作者同时设计了涵盖特征归因、反事实推理和虚假特征检测的问题类型,并为每类配备基于扰动的忠实度指标。研究发现前沿 LLM 会系统性地产生不忠实的解释;在六份数据集上,加入模态自适应惩罚的忠实度奖励优化,使 MEA 相比未训练骨干分别提升 28%(表格)、21%(文本)和 34%(视觉),并优于事后解释方法、智能体式和闭源基线。

阅读原文huggingface.co