跳到正文
原文
arXiv· arXiv:2610.00400· Haoyu Wang, Wei Zhao, Yedi Zhang, Christopher M. Poskitt, Jun Sun·· 2 小时前精选关注度80

DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险

Representation Transitions Reveal Emerging Safety Risks in Multi-Turn LLM Agents

AI 导读

新加坡管理大学等机构的研究者提出 DART,一种复用智能体隐藏状态的运行时防御框架,通过监测上下文更新引发的表征位移来检测多轮攻击。多轮攻击由多个单独合规的步骤组合而成,DART 将每段上下文引起的表征位移投影到去噪后的安全方向上并累加,超过校准阈值时把位移归因到贡献最大的上下文片段,并追加针对性提醒而不删除上下文或中止执行。在六个模型和两个多轮基准上,DART 把 MT-AgentRisk 的攻击成功率从 84% 降到 25%,拦下全部攻击,平均误报率 12%,良性请求的不拒答率下降 8%;同一协议下 ToolShield 的攻击成功率为 55%,DART 在六个模型上都优于它。在 ASEval 上攻击成功率从 97% 降到 52%,无良性拒答损失。去噪是关键,未去噪的监控在 ASEval 上只捕获 7%–40% 的攻击,去噪后为 60%–85%。同一监控无需修改即可覆盖单轮间接注入,每步仅增加 0.14–0.56 秒开销,且不需要辅助模型。

论文速读

问题
多轮智能体攻击可将单独合规的步骤组合成有害结果,现存单步检测或动作拦截难以防范。推测模拟等防御手段依赖额外模型,计算开销较大。
方法
提出运行时防御框架DART。利用智能体内部表征转移构建安全方向,通过去除良性均值与协方差主成分消除漂移,在累加转移超标时定位触发上下文并追加针对性提示词。
实验与结果
在6个模型上,DART使MT-AgentRisk的平均ASR从84%降至25%,在ASEval上使平均ASR从97%降至52%。在M3 Ultra上每步仅增加0.14–0.56秒开销。
局限与可以继续做的
提示词归因在8B模型上可能加剧遵从;内在滥用缺乏清晰表征转移;多轮分解任务缺乏可剔除的外部有害片段;实验仅在本地8位模型和模拟工具环境中开展。

据 论文 PDF(Gemini 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文给出一种复用智能体隐藏状态的运行时监控,用去噪后的表征位移在多轮攻击中检测并归因触发上下文。

阅读原文arxiv.org