Agent MechSuits:面向多轮 CLI Agent 的机制子空间安全引导
Agent MechSuits: Mechanistic Subspace Safety Steering for Multi-Turn CLI Agents
AI 导读
论文提出 Agent MechSuits,一个白盒防御框架,从步骤级隐藏表示中检测 CLI Agent 的有害执行状态,并通过干预单层内一个 10 维子空间来缓解不安全行为。作者同时发布 Mechanistic Agent Safety(MAS)基准,包含 194 个任务的多轮执行轨迹标注,覆盖 LLaMA-3.1-8B、Qwen-2.5-7B 和 Gemma-2-9B。实验显示该框架具备较强的安全检测性能,并初步显示出前瞻性风险预判能力,显著减少了 CLI Agent 的有害动作。论文已被 NeurIPS 2026 接收。