TACIT:从 LLM 内部状态检测 Agent 轨迹危害
Agent Safety From Within: Detecting Harmful Trajectories from LLM Internal States
作者提出基于冻结内部表征读取的TACIT检测智能体轨迹;在6个基准上Qwen3-4B Multi-layer平均macro-F1达86.2%(Table 1)。
受害系统为工具调用智能体。攻击与风险形式包括两类证据:直接表达的有害内容(harmful content)和不安全工具使用(unsafe tool use,如 prompt injection、goal hijacking、authorization violation、privacy leakage、data exfiltration、破坏性操作等),判定标准为轨迹中任一步骤是否不安全。
- 智能体在工具调用中可能引发有害内容或不安全工具使用等风险。现有开源 Guard 模型主要针对单轮文本内容审核,在工具调用轨迹上表现较差,尤其是当不安全行为取决于动作与上下文/工具模式是否一致时,Guard 模型的输出端难以区分(Section 1、3.1)。
- 作者先通过对比激活分析证实两种风险在模型内部表征中线性可读且方向正交;随后提出 TACIT,固定预训练骨干网络不更新参数,对中间层隐藏状态进行池化,通过训练线性探针或多层特征聚合分类器直接输出安全评分,无需生成任何 token(Section 4.1)。
- 在 6 个轨迹安全基准上,Qwen3-4B 的 TACIT Multi-layer 平均 macro-F1 达到 86.2%,高于评测的 Guard 基线最高值 62.3%(Table 1);留一基准评估下平均达 65.7%(Table 2),且单条轨迹检测延迟为 40ms(Figure 4c)。
- 作者指出当前评测针对整条轨迹而非流式动作边界;直接用于前缀判定时可能在智能体动作前因请求内容提前触发拦截;实验覆盖了 6 个基准、2 个模型家族,未报告闭环环境下的流式干预对任务效用的影响(Section 5.3、Appendix D)。
- 模型
- Qwen3Guard-4BLlamaGuard3-8BAgentDoG-4BQwen3-4BLlama-3.1-8BQwen3-4B-InstructLlama-3.1-8B-InstructGPT-4oo3-mini
- 基准
- R-JudgeTraceSafeATBenchASSEBenchOpenAgentSafetyAgentDojo
- 指标
- macro-F1rank accuracyAUCprecisionrecall
多伦多大学研究者提出 TACIT,用冻结 LLM 内部状态的线性探针判断工具调用轨迹是否安全,不解码任何 token。分析发现,现有开源护栏模型对不安全工具使用在输出上仅相当于随机水平,但该区分在模型内部状态中线性可读,且与有害内容方向近乎正交,两者不能互相替代。在六个轨迹安全基准上,TACIT 将平均 macro-F1 从最强开源护栏的 62.3 提升到 86.2(Qwen3-4B)和 85.4(Llama-3.1-8B);每个基准完全留出训练时仍以 65.7 对 61.1 领先。相同骨干、数据与测试划分下,冻结读数与全量安全微调相当,叠加在微调模型上还能进一步提升;探针可训练参数量约为全量微调的百万分之一,训练时间约六分之一,推理延迟 40ms,低于 Qwen3Guard 的 215ms。
推荐理由论文给出用冻结模型内部状态做轨迹安全判读的方法,并附与护栏模型和全量微调的对比数据,可供做 Agent 监控的团队参考。
深度解读
这篇论文试图解决什么问题?
解决开源 Guard 模型在智能体轨迹上难以有效检测不安全工具使用与多步交互风险的问题。
这篇论文试图解决语言模型智能体在工具调用轨迹中的安全风险检测问题,特别是现有开源 Guard 模型在识别“不安全工具使用”时输出端失效的困境。
- 问题场景与重要性:大语言模型作为智能体能够调用外部工具执行搜索、发信息、执行代码等操作,使潜在危害扩展到了实际环境交互;安全判定不再仅仅取决于单条文本的有害性,更取决于动作与交互上下文是否一致(Section 1)。
- 现有方法的不足:作者称现有主流开源 Guard 模型(如 Llama Guard、Qwen3Guard)主要面向对话内容审核;在工具调用轨迹上,即便专用智能体 Guard(如 AgentDoG)也难以有效区分由工具模式改动引起的不安全工具调用,在输出端的区分能力接近随机(Section 1、3.1)。
- 核心观察与假设:作者观察到智能体轨迹风险包含“有害内容”(harmful content)与“不安全工具使用”(unsafe tool use)两类证据;虽然 Guard 模型的生成输出丢失了不安全工具调用的判别能力,但该信号在模型中间隐藏状态中依然线性可读,且两类风险的内部表征方向接近正交(Section 3.1、3.2)。
- 论文提出的方案:作者提出了 TACIT,直接从冻结的大模型中间层隐藏状态中读取表征并训练轻量分类器,不更新大模型参数且不解码任何 token,实现低延迟且高精度的轨迹安全检测(Section 4.1)。
- 威胁模型:
- 攻击者目标:促使智能体执行有害请求,或利用间接提示注入(prompt injection)、目标劫持、未授权操作、隐私数据外泄或工具参数误用造成环境危害(Section 1、Appendix A.1)。
- 攻击者知识与能力:攻击者可注入恶意指令于工具返回值或提示词中,诱导智能体在工具调用中传入不匹配的参数、绕过授权或向外部地址外发敏感数据;评测包含无盒及黑盒环境下的交互轨迹(Section 1、4.2)。
- 受害系统:基于大语言模型的工具调用智能体系统,具有多轮交互环境及外部工具调用能力(Section 1、4.1.1)。
- 安全判定标准:完整轨迹中只要有任意一步骤不安全,整条轨迹即被判定为不安全 y = 1(Section 4.1.1)。
有哪些相关研究?
涉及智能体轨迹安全基准、安全 Guard 模型以及基于模型内部表征的安全检测与干预三类研究。
论文讨论的相关工作主要分布在智能体轨迹安全基准、Guard 模型以及内部表征安全应用三个方面:
- 智能体轨迹安全基准(Agent Trajectory Safety):
- Ruan 等(2024)的 ToolEmu、Zhang 等(2024)的 Agent-SafetyBench、Andriushchenko 等(2025)的 AgentHarm 以及 Yuan 等(2024)的 R-Judge,评估智能体在工具交互中的不安全行为与风险识别能力。
- Chen 等(2026)的 TraceSafe 与 Li 等(2026b)的 ATBench,针对完整工具调用轨迹进行评分,覆盖了跨步出现的安全风险。
- Guard 模型(Guard Models):
- Inan 等(2023)的 Llama Guard、Han 等(2024)的 WildGuard 与 Zhao 等(2025a)的 Qwen3Guard,作为辅助模型对提示词或回复生成安全判断,是开源内容审核的主流方案。
- Chen 等(2026)的 TraceSafe 评估了现有 Guard 在工具调用轨迹上的表现;Liu 等(2026)的 AgentDoG 则通过微调专门训练用于评估和诊断完整智能体轨迹的专用 Guard 模型。
- 内部表征安全应用(Internal Representations for Safety):
- Alain & Bengio(2017)、Burns 等(2023)、Azaria & Mitchell(2023)等使用线性探针揭示模型中间层表征中的潜在知识,表明部分内部信息在生成输出端并未被可靠表达。
- Zhou 等(2024)、Zhao 等(2025b)、Jiao 等(2024, 2026)利用内部激活分析对齐与越狱机制,或从冻结 LLM 的神经元中读取分类结果以检测有害输入输出;作者指出自身工作拓展至工具调用轨迹,处理即使单条消息均无害但轨迹整体不安全的场景。
- 基线方法与基准数据集:
- 论文对比的基线包括开源 Guard 模型 Qwen3Guard-4B、LlamaGuard3-8B 以及专用智能体 Guard 模型 AgentDoG-4B;使用的评测基准包括 R-Judge、TraceSafe、ATBench、ASSEBench、OpenAgentSafety 和 AgentDojo 共 6 个轨迹安全基准(Section 4.2)。
- 与既有工作的定位区别:作者指出,TACIT 保持了 Guard 模型与被监控智能体相互独立的模块化隔离,但摒弃了通过解码生成安全标签的做法,改为直接从冻结骨干网络的内部状态读取安全评分(Section 2.2、2.3)。
- 智能体轨迹安全基准(Agent Trajectory Safety):
论文如何解决这个问题?
提出 TACIT,从冻结骨干网络的中间层读取表征并通过线性探针、集成或多层聚合输出安全评分。
作者提出 TACIT(Trajectory Assessment by Classifying Internal Transformer states)框架,通过直接从冻结语言模型的内部隐藏状态中读取表征,无需解码任何 token 即可完成轨迹安全判断。
问题设定与表征提取
- 轨迹分类问题形式化:给定一条包含多轮交互的完整轨迹 tau,Guard 模型预测二元标签 y in {0, 1},当 tau 中存在任意一步不安全时 y = 1(Section 4.1.1)。
- 单次前向传递:利用大模型骨干网络的原生 chat template 渲染整条轨迹 tau(保留系统提示词、工具 schema、消息角色及交互顺序),执行单次前向传播得到各层隐藏状态(Section 4.1.1)。
- 表征池化:在每个候选层 l,将序列状态池化为单个向量 xl(tau);池化策略通过验证集在取最后一个 token 的状态、所有 token 的均值向量,或两者的拼接(last+mean)中选择(Section 4.1.1、Appendix B.4)。
线性探针(Probe)设计
- 线性表征假设的应用:基于语义概念在 LLM 中多呈线性表征的假设,TACIT 对候选层 l 的标准化特征向量训练线性探针,输出不安全概率:
sl(τ) = σ(ul⊤ x̃l(τ) + cl) 该公式利用 Sigmoid 函数对标准化隐藏状态进行线性变换并计算不安全概率(公式 1)。
- 优化与超参数:采用 L2 正则化的逻辑回归拟合权重 ul 和偏置 cl;训练样本按类别在各基准内进行逆频数加权,使各基准每个类别的总权重相等;正则化强度倒数 C 与层索引 l 在验证折上进行选择,决策阈值固定为 0.5(Section 4.1.2、Appendix B.4)。
轻量精炼读取机制(Refined Readouts)
- 集成读取(Ensemble):利用前向逐步选择法(forward selection with replacement),在候选探针中迭代加入能够最大化 6 个基准平均 AUROC 或 macro-F1 的探针并平均其预测概率,搜索预算设定为 5、10 或 20 次添加(Section 4.1.2、Appendix C.1)。
- 多层特征聚合(Multi-layer Aggregation):先在各层利用 L1 正则化辅助探针按权重绝对值筛选出累积权重占比达 eta 的显著维度集合;随后拼接各层显著特征并在拼接特征上拟合 L2 正则逻辑回归或单隐层 MLP 分类头(Section 4.1.2、Appendix C.2)。
- 参数与冻结特性:所有探针与精炼层均在冻结骨干网络的离线激活上拟合,骨干网络完全不参与反向传播,且推断时无需进行自回归解码(Section 4.1.1、4.3.2)。
论文做了哪些实验?
在 6 个基准上评测了检测性能、留一泛化能力、与 SFT 结合效果及训练与推理效率。
实验设置
- 被测模型:评测的开源 Guard 基线为 Qwen3Guard-4B、LlamaGuard3-8B 和 AgentDoG-4B;TACIT 与全量 SFT 所使用的骨干模型为 Qwen3-4B 与 Llama-3.1-8B;机理分析中涉及 Qwen3-4B-Instruct 与 Llama-3.1-8B-Instruct;OpenAgentSafety 轨迹源包含 GPT-4o 与 o3-mini 等(Section 4.2、Appendix B.1、B.2)。
- 数据集与规模:评测包含 6 个标注智能体轨迹安全基准,总计 9,487 条轨迹(不安全 3,996 条,安全 5,491 条),测试集保留 1,900 条:R-Judge(571条,测试116条)、TraceSafe(2,250条,测试449条)、ATBench(1,000条,测试200条)、ASSEBench(合并Safety与Security共2,293条,测试455条)、OpenAgentSafety(1,298条,测试259条)、AgentDojo(收集2,075条,测试421条)(Table 4)。
- 基线方法:对话内容审核 Guard 模型 Qwen3Guard-4B 与 LlamaGuard3-8B,以及专为智能体轨迹训练的专用 Guard 模型 AgentDoG-4B(Section 4.2)。
- 评价指标:主要评价指标为各基准的 macro-F1(以应对类别不平衡)及 6 个基准的平均 macro-F1(Avg);机理分析中采用成对排序准确率(rank accuracy)及受试者工作特征曲线下面积(AUC)(Section 4.1.2、4.2、Appendix A.2)。
- 评审方式与阈值:Guard 基线使用官方发布管道与贪婪解码,Qwen3Guard 将 Controversial 映射为 unsafe;TACIT 线性探针使用固定阈值 0.5;置信区间基于基准内 2,000 次轨迹 bootstrap 重采样计算 95% 置信区间半宽(Section 4.2、Appendix B.1、B.2、B.3、B.4)。
- 数据划分与协议:采用场景感知的 80%/20% 训练验证与测试划分,相同场景与请求的轨迹分配至同一侧;在 80% 训练集内部采用 4 折验证进行超参数与层选择,选定后在 80% 全部数据上重拟合,并仅在测试集上评估一次(Appendix B.3)。
主结果
表格较宽,可左右滑动
模型/方法 R-Judge TraceSafe ATBench ASSEBench OAS AgentDojo 平均 Qwen3Guard-4B 32.2 34.7 36.8 43.6 38.2 44.9 38.4 LlamaGuard3-8B 66.3 48.6 38.9 60.6 35.9 62.5 52.2 AgentDoG-4B 92.7 44.7 63.3 81.4 43.3 48.2 62.3 TACIT Probe (Qwen3-4B) 95.0 77.5 93.5 85.2 67.9 65.1 80.7 TACIT Ensemble (Qwen3-4B) 97.0 88.7 95.0 88.5 72.0 71.0 85.4 TACIT Multi-layer (Qwen3-4B) 97.0 86.5 94.5 89.8 72.7 76.9 86.2 TACIT Probe (Llama-3.1-8B) 98.0 79.7 89.5 88.1 67.5 66.6 81.6 TACIT Multi-layer (Llama-3.1-8B) 97.0 89.6 95.0 88.5 69.8 72.2 85.4 (注:据 Table 1,略去 Llama-3.1-8B 的 Ensemble 行,其平均值为 85.1%)
- 在全部基准上高于既有 Guard:作者指出,在相同骨干网络下,仅使用单层线性探针(Probe)即可在平均 macro-F1 上较 Qwen3Guard-4B 高出 42.3 个百分点,较 LlamaGuard3-8B 高出 29.4 个百分点,较专用智能体 Guard 模型 AgentDoG-4B 高出 18.4 个百分点(Section 4.3.1)。
- 精炼读取进一步提升性能:多层特征聚合(Multi-layer)在 Qwen3-4B 和 Llama-3.1-8B 上将 6 个基准的平均 macro-F1 进一步提升至 86.2% 和 85.4%(Section 4.3.1)。
- 复杂与黑盒来源场景下的表现:作者称,在指令注入来源隐蔽的 AgentDojo 上,Multi-layer 读取达到 76.9%,高于 Guard 基线的最高值 62.5%;在轨迹来自 GPT-4o 等黑盒智能体的 OpenAgentSafety 上,探针读取在未接触被监控模型的情况下超过基线 24 个百分点以上(Section 4.3.1)。
留一基准泛化评估(Leave-One-Benchmark-Out)
- 评测设置:将 6 个基准中的某一个完全排除在训练之外,仅使用其余 5 个基准的所有轨迹训练读取器,并在被扣除的基准全量轨迹上进行零样本迁移测试(Section 4.3.1、Table 2)。
- 测试结果:在 Qwen3-4B 上,Probe、Ensemble 和 Multi-layer 的平均 macro-F1 分别为 62.6%、63.3% 和 65.7%,均高于在全部 6 个基准全量数据上评估的 AgentDoG-4B(平均 61.1%);在 Llama-3.1-8B 上,Multi-layer 达到 63.5%(Table 2)。
- 作者解读:作者指出,TACIT 每折训练仅使用约 7,900 条轨迹,而 AgentDoG 合成了超过 100,000 条轨迹;在未见过的基准上,内部读取依然保持了对强基线的领先优势(Section 4.3.1)。
与全量安全微调(Full SFT)对比与叠加
- 评测设置:在相同骨干网络和相同训练池(平均每折约 5,700 条轨迹)下,对比冻结表征读取与全参数安全微调(SFT)及其两者的结合效果(Section 4.3.1、Appendix B.2、Table 6)。
- 测试结果:冻结探针单独得分较 SFT 低 3.5 和 4.2 个百分点,但 Multi-layer 使得 Qwen3-4B 达到 86.2%(SFT 为 84.2%),Llama-3.1-8B 达到 85.4%(SFT 为 85.8%);在 SFT 模型上叠加 Multi-layer 读取,两者的平均 macro-F1 进一步提升至 86.5% 和 87.0%(增益分别为 +2.3 和 +1.2 个百分点)(Table 1、Table 6)。
- 作者解读:作者认为内部状态读取与安全微调是互补的,冻结读取在性能上能与全量微调持平,并在微调模型上取得进一步提升(Section 4.3.1)。
训练与服务效率对比
- 评测设置:在 Qwen3-4B 上对比可训练参数量、训练耗时以及单条轨迹前向生成的端到端检测延迟(Section 4.3.2、Figure 4)。
- 测试结果:单层 Probe 可训练参数量为 5,121(Qwen3-4B)和 8,193(Llama-3.1-8B),仅为全量 SFT(4.0B 参数)的约百万分之一;训练时间从 SFT 的 2.11 小时降至 Probe 的 0.36 小时;推理检测延迟 TACIT 为 40ms(生成 0 个 token),AgentDoG 为 53ms(解码 2 个 token),Qwen3Guard 为 215ms(解码 13.2 个 token)(Figure 4)。
- 作者解读:作者称 TACIT 无需自回归解码,延迟较 Qwen3Guard 降低 82%,且多层聚合读取位于成本-精度 Pareto 前沿(Section 4.3.2)。
其他消融与分析
- 阈值校准:对基线按基准校准阈值后,Qwen3Guard-4B 平均升至 54.4%,LlamaGuard3-8B 升至 60.9%,AgentDoG-4B 升至 65.5%,仍落后 Probe 15 个百分点以上(Table 5)。
- 内部层选择:Qwen3-4B 探针验证集 macro-F1 随层数加深上升并在第 22 层达到峰值 80.9%,最终层略降至 79.0%(Section 5.1、Figure 5)。
- 提前退出(Early Exit):在第 22 层截断并丢弃后续 14 层网络时,Multi-layer 读取保持了 85.3% 的 macro-F1,保留了全深度时 86.2% 的约 99%(Section 5.1)。
- 特征稀疏度:在 Qwen3-4B 和 Llama-3.1-8B 上仅保留 2.0% 和 2.3% 维度时,宏 F1 仅较最优系数下降 1.3 和 1.4 个百分点(Section C.2.1、Figure 11)。
- 决策维度分离:对 TraceSafe 与 HAICOSYSTEM 贡献各半数 logit 差异的特征维度集合(各 23 维和 16 维),对另一风险形式的贡献分别仅为 10.9% 和 0.7%(Section 5.2、Figure 6)。
- 失败案例与前缀触发:在 ASSEBench-Safety 案例中,TACIT 在仅收到用户请求、智能体尚未采取行动时得分即达到 0.81,高于判定阈值(Appendix D、Table 9b)。
有什么可以进一步探索的点?
作者指出流式检测需动作级评测与闭环校准,且需构建平衡两类风险的基准;实验覆盖 6 个离线基准与 2 类模型。
作者指出的局限与后续方向
- 两类风险的训练数据构建:作者在 Future Work 中指出,不安全工具使用与有害内容在内部表征上近乎正交,覆盖一种并不代表覆盖另一种,而不安全工具使用在所有评测系统中表现均相对更弱;未来需要特意构建在一致标签下同时涵盖两种风险形式的轨迹安全语料(Section 5.3)。
- 针对智能体轨迹的红队攻防探索:作者在 Future Work 中指出,智能体轨迹通过注入工具结果、长上下文及工具调用格式为攻击者提供了比单轮文本更大的攻击面,因此针对智能体轨迹的红队攻击以及对应的防御是未来独立的研究方向(Section 5.3)。
- 流式检测与前缀误拒的权衡:作者在 Appendix D 中指出,固定阈值监控可能在智能体仅收到用户请求、尚未采取任何行动时就提前越过阈值(如 Table 9b 案例),但类似表征同样出现在最终拒绝并被标注为安全的轨迹中,因此挑战在于避免过早拦截原本可能做出正确拒答的智能体(Appendix D)。
- 前缀级校准与闭环评测:作者在 Appendix D 中指出,本研究评测的 6 个基准均针对整条轨迹进行标注,未能支持动作边界处的流式校准和闭环干预评测;真正的流式检测需要单个步骤的标签、在候选动作执行前介入的接口、触发规则以及干预对任务效用损耗的量化评估,作者将前缀校准和闭环评测留作未来工作(Appendix D)。
实验覆盖范围
- 基准与轨迹类型:评测覆盖了 6 个公开轨迹安全基准(R-Judge、TraceSafe、ATBench、ASSEBench、OpenAgentSafety、AgentDojo),共计 9,487 条离线标注轨迹(Table 4)。
- 模型家族覆盖:骨干模型覆盖了 Qwen3-4B 与 Llama-3.1-8B 两个开源模型家族,评测的 Guard 基线包含 Qwen3Guard-4B、LlamaGuard3-8B 和 AgentDoG-4B(Section 4.2)。
- 评测协议与任务形式:实验针对离线成对对比(成对排序准确率)与离线整条轨迹分类(macro-F1)进行测试,最长截断长度为 16,384 tokens(Section 3.1、Appendix B.2、B.3)。
- 未包含的评测对象:论文明确指出未将通用 LLM 评审(general-purpose LLM judges)作为 Guard 基线,理由是其提示词、评分规则与推理预算会显著影响成本与表现,从而无法构成对专用本地 Guard 输出的受控对比(Appendix B.2)。
- 未报告的信息:论文未报告在实际部署环境中实时在线拦截动作对智能体正常任务完成率(task utility)的影响,也未报告各基准的人工复核一致性指标。
总结一下论文的主要内容
提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
- 研究定位:该研究针对工具调用智能体的轨迹安全检测难题,从表征分析出发,系统探讨了 Guard 模型在识别“不安全工具使用”时的内部机制与输出失效现象,并据此设计了基于内部表征读取的安全检测方法 TACIT。
- 核心问题:现有开源 Guard 模型主要面向单轮文本内容审核,而在多步智能体轨迹中,不安全行为往往取决于动作与上下文/工具模式的不匹配;此类不安全工具调用在现有 Guard 模型的输出端难以被有效区分(Section 1、3.1)。
- 方法要点:通过受控实验发现不安全工具使用与有害内容在中间隐藏层线性可读且几何方向近乎正交;TACIT 利用冻结骨干网络单次前向传递提取各层表征并进行池化,通过在中间层训练轻量线性探针、集成或多层显著特征聚合分类器输出安全评分,无需更新骨干参数且完全不产生自回归解码(Section 3、4.1)。
- 核心实验结果:
- 在 6 个主流轨迹安全基准测试中,Qwen3-4B 骨干上的 TACIT Multi-layer 取得 86.2% 的平均 macro-F1,大幅超越专用的 AgentDoG-4B(62.3%)与内容 Guard 基线(Table 1)。
- 在完全排除目标基准的留一泛化测试中,Qwen3-4B 的 Multi-layer 取得 65.7% 的平均 macro-F1,依然领先于基线(Table 2)。
- 在相同数据和骨干控制下,冻结表征读取的效果与全量参数微调(84.2%)相当,且在微调模型上叠加 Multi-layer 读取可进一步提升至 86.5%(Table 6)。
- TACIT 线性探针训练参数量仅 5,121 个,单条轨迹检测耗时仅 40ms,较 Qwen3Guard(215ms)延迟降低 82%(Figure 4)。
- 启示与结论:作者称内部表征为检测智能体轨迹危害提供了实用的基础;未来需构建系统覆盖工具使用与有害内容两类正交风险的专用基准,并深入探索动作边界上的流式干预机制(Section 5.3、6)。