SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE
SEAD: A State-Based Perspective on Attack and Defense in Tool-Using Agents
AI 导读
论文把工具型 Agent 的攻击与防御统一建模为部分可观测状态控制问题,并提出攻击方法 DART 与防御方法 SAGE。DART 把有害目标拆解为局部看似合理的步骤,利用真实工具执行的反馈做轨迹树搜索;SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截。在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8 至 35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界处拦截 92.73% 的有害路径;在线攻防评估中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,且在四种攻击方法和训练未见过的 PostgreSQL、Web 域上仍然有效。代码与数据已开源于 GitHub。
论文速读
- 语言模型 agent 通过工具对外部系统执行动作,早期动作会改变文件、权限或数据库状态,使后续看似常规的动作变得有害;而可见的交互历史未必暴露判断该动作所需的底层状态。作者把攻击与防御统一建模为部分可观测的状态控制问题(SEAD)。
- 作者从共享执行过程推导攻击与防御的设计要求:攻击端 DART 把有害目标拆成局部合理的步骤,用真实工具执行的反馈做轨迹树搜索;防御端 SAGE 在执行前通过只读查询调查相关状态,再决定放行或拦截,被拦截后新提出的动作会再次受检。
- 在四个目标模型上,DART 的语义攻击成功率比最强基线高 18.8–35.9 个百分点,可执行验证下也有一致提升。在记录轨迹上,SAGE 保留 95.79% 的良性轨迹,并在有害边界拦截 92.73% 的有害路径;在线对抗中把 DART 的可执行攻击成功率从 48.0% 降到 4.0%,对四种攻击方法均有效,并能泛化到训练未见过的领域。
- SEAD 假设有可信执行层在动作生效前拦截,状态调查限于只读、防御者私有的查询;并发进程、复合动作和助手输出泄露需要扩展该干预接口。实验覆盖四个工具领域、四个目标模型,防御评估只用 GPT-5.6 Luna,且 PostgreSQL 与 Web 未参与防御微调;更广的目标覆盖和对搜索、调查各组件的受控研究是后续方向。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文把工具型 Agent 的攻击与防御统一到部分可观测状态控制框架下,并给出可复现的数据集与代码,适合做 Agent 安全评测的团队参考。