评测与基准arXiv 2610.02480
MEA:面向忠实模型解释的奖励驱动多智能体系统
提出奖励驱动多智能体系统 MEA,生成可扰动核对的忠实解释
- arXiv
- 2610.02480
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Qwen3.6-35B-A3B、Qwen3.5-4B、Qwen3-VL-30B-A3B-Instruct 等 15 个
摘要MEA 用忠实性奖励训练双智能体,把工具输出收成可扰动核对的解释。
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。