可解释性arXiv 2609.34686
研究揭示工具智能体中越狱上下文残留导致的安全路由分化
用配对续写与激活修补揭示工具智能体越狱后的安全路由分化
- arXiv
- 2609.34686
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemma-3-12B、Gemma-4-12B、Qwen3-14B 等 8 个
- 攻击越狱
摘要越狱后的同一安全反馈在八个工具智能体上分成三条路由,因果集中在最后几层并可作预测基线。
这篇工作把越狱上下文残留之后的运行时安全反馈,做成工具智能体上的三路路由问题,并用激活修补给这个路由一个晚层的因果位点。作者认为,反馈可能恢复合法执行、留下未授权动作,或误伤良性流程,而现有攻击、基准和静态护栏没有在固定历史上把这三种结局分开。配对续写因此从同一冻结检查点分别接中性提醒 N 和安全反馈 S,并交叉保留越狱 J+ 与中和越狱 J0。