MEA:面向忠实模型解释的奖励驱动多智能体系统
提出奖励驱动多智能体系统 MEA,生成可扰动核对的忠实解释
- arXiv
- 2610.02480
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- Qwen3.6-35B-A3B、Qwen3.5-4B、Qwen3-VL-30B-A3B-Instruct 等 15 个
摘要MEA 用忠实性奖励训练双智能体,把工具输出收成可扰动核对的解释。
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。
提出奖励驱动多智能体系统 MEA,生成可扰动核对的忠实解释
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。
提出操作有效性契约,审计激活监控的告警策略
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
作者测量一套看守智能体基础设施的不变式套件:通常拿来许可部署的「通过正确代码、失败损坏代码」,实际上能支持什么。
审计 Active Inference Agent 上 LLM 解释器的监督叙述失败
作者审计的是挂在智能体上的运行时解释器,而不是智能体本身。操作员读到的是信念与动作的自然语言叙述。作者要问哪些可复现触发会让这段叙述失败,以及失败痕迹是什么样。
用因果审计检验视觉工具观察是否真正改变答案
对六个 thinking-with-images 模型做因果审计,检查 crop-and-zoom 返回的观察是否中介最终答案。
提出 REGEXROUTE,用 SAE 引导的正则特征做 LLM 路由
提出 DoM 探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征
SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。
提出 GenV,检测求解器判定无法区分的不忠实形式化
GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。
用配对续写与激活修补揭示工具智能体越狱后的安全路由分化
这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。