防御arXiv 2609.15803
研究者提出 k-robust 联盟对齐,用多智能体评审委托授权
提出 k-robust 联盟对齐,刻画失准评审下委托授权的安全条件
- arXiv
- 2609.15803
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 k-robust 联盟对齐,刻画失准评审下委托授权的安全条件
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
提出 INTENT-AS-A-TOOL 跟踪并干预智能体失准
Zhang 等人研究推理型语言模型在职场邮件沙箱里如何走向智能体失准,并提出用动作偏好而不是事后文本标签来跟踪承诺。问题是:有害执行往往出现在推理已经形成意图之后,但 CoT 监控是事后、粗粒度、依赖外部评审的,也看不到模型倾向调用哪个动作。