跳到正文
原文
Hugging Face Daily Papers·· 4 天前精选关注度80

SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

SEAD: A State-Based Perspective on Attack and Defense in Tool-Using Agents

AI 导读

论文把工具型 Agent 的攻击与防御统一建模为部分可观测状态控制问题,并提出攻击方法 DART 与防御方法 SAGE。DART 把有害目标拆解为局部看似合理的步骤,利用真实工具执行的反馈做轨迹树搜索;SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截。在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8 至 35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界处拦截 92.73% 的有害路径;在线攻防评估中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,且在四种攻击方法和训练未见过的 PostgreSQL、Web 域上仍然有效。代码与数据已开源于 GitHub。

论文速读

问题
语言模型 agent 通过工具对外部系统执行动作,早期动作会改变文件、权限或数据库状态,使后续看似常规的动作变得有害;而可见的交互历史未必暴露判断该动作所需的底层状态。作者把攻击与防御统一建模为部分可观测的状态控制问题(SEAD)。
方法
作者从共享执行过程推导攻击与防御的设计要求:攻击端 DART 把有害目标拆成局部合理的步骤,用真实工具执行的反馈做轨迹树搜索;防御端 SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截,被拦截后新提出的动作会再次受检。
实验与结果
在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8–35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界拦截 92.73% 的有害路径;在线对抗中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,对四种攻击方法均有效,并能泛化到训练未见过的领域。
局限与可以继续做的
SEAD 假设有可信执行层在动作生效前拦截,状态调查限于只读、防御者私有的查询;并发进程、复合动作和助手输出泄露需要扩展该干预接口。实验覆盖四个工具领域、四个目标模型,防御评估只用 GPT-5.6 Luna,且 PostgreSQL 与 Web 未参与防御微调;更广的目标覆盖和对搜索、调查各组件的受控研究是后续方向。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文把工具型 Agent 的攻击与防御统一到部分可观测状态控制框架下,并给出可复现的数据集与代码,适合做 Agent 安全评测的团队参考。

阅读原文huggingface.co