TACIT:从 LLM 内部状态检测 Agent 轨迹危害
提出TACIT,读取冻结隐藏状态以检测智能体有害轨迹
- 研究定位:该研究针对工具调用智能体的轨迹安全检测难题,从表征分析出发,系统探讨了 Guard 模型在识别“不安全工具使用”时的内部机制与输出失效现象,并据此设计了基于内部表征读取的安全检测方法 TACIT。
- 核心问题:现有开源 Guard 模型主要面向单轮文本内容审核,而在多步智能体轨迹中,不安全行为往往取决于动作与上下文/工具模式的不匹配;此类不安全工具调用在现有 Guard 模型的输出端难以被有效区分(Section 1、3.1)。
- 方法要点:通过受控实验发现不安全工具使用与有害内容在中间隐藏层线性可读且几何方向近乎正交;TACIT 利用冻结骨干网络单次前向传递提取各层表征并进行池化,通过在中间层训练轻量线性探针、集成或多层显著特征聚合分类器输出安全评分,无需更新骨干参数且完全不产生自回归解码(Section 3、4.1)。
- 核心实验结果:
- 在 6 个主流轨迹安全基准测试中,Qwen3-4B 骨干上的 TACIT Multi-layer 取得 86.2% 的平均 macro-F1,大幅超越专用的 AgentDoG-4B(62.3%)与内容 Guard 基线(Table 1)。
- 在完全排除目标基准的留一泛化测试中,Qwen3-4B 的 Multi-layer 取得 65.7% 的平均 macro-F1,依然领先于基线(Table 2)。
- 在相同数据和骨干控制下,冻结表征读取的效果与全量参数微调(84.2%)相当,且在微调模型上叠加 Multi-layer 读取可进一步提升至 86.5%(Table 6)。
- TACIT 线性探针训练参数量仅 5,121 个,单条轨迹检测耗时仅 40ms,较 Qwen3Guard(215ms)延迟降低 82%(Figure 4)。
- 启示与结论:作者称内部表征为检测智能体轨迹危害提供了实用的基础;未来需构建系统覆盖工具使用与有害内容两类正交风险的专用基准,并深入探索动作边界上的流式干预机制(Section 5.3、6)。