可解释性arXiv 2610.06576
研究:智能体欺骗行为在外部显现前已可从内部表征预测
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
- arXiv
- 2610.06576
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 被测模型
- Qwen3-14B
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出基于决策前隐藏状态的检测与引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞
摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。
提出条件特征抑制防御,检出对抗补丁后抑制 VLA 内部特征
摘要条件抑制与 patch 相关的 SAE 特征,间歇攻击下可提高 SR,持续攻击下则不能。
提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。