跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 14 篇

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2610.09793 ·

    用时序逻辑监控工具 Agent:MonPoly 标出 71.8% STAC 攻击链,但溯源检查被一行注入骗过 94%–99%

    提出基于MonPoly的时序逻辑监控,离线检出工具智能体危险动作链

    测试
    GPT-4o、Sonnet-3.5应用层
    场景
    AI Agent
    摘要形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。

    完整解读
  2. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  3. 分析与理论arXiv:2610.04375 ·

    论文揭示 LLM Agent 工具调用在执行路径中被改写,并提出 IntAct 修复方案

    提出IEC协议与IntAct,定位并修复工具调用执行路径的静默篡改

    测试
    qwen3-coder-plus、Qwen2.5-Coder-32B、Qwen2.5-72B 等 4 个应用层
    摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
    • 研究定位:针对大语言模型智能体工具调用在底层执行路径中的保真度问题,论文界定了意图-执行对应性概念,提出了无执行偏离检测协议 IEC 与跳级修复框架 IntAct。
    • 核心问题:命令在宿主包装器、Shell解析、进程接口等多跳传输中常遭隐蔽篡改,现有评测默认调用按原样执行,导致大量路径缺陷被系统性误归因于大语言模型。
    • 方法设计:IEC协议利用无害见证探针与接收端自身解析器,在不执行命令的前提下定位首偏离跳;IntAct根据定名跃点采用无解析通道(如文件注入、参数转义、Base64编码)进行针对性渲染交付,或对超域调用予以安全拒绝。
    • 关键实验结果:
      1. 生产会话中10.0%的暴露Shell调用被路径篡改,Claude Code的Bash工具在传输长文本或代码时篡改率达12.0%,且80.7%的反斜杠合并故障未报任何错误(Figure 3a、Figure 3b)。
      2. 传统轨迹评测将95.1%的生产失败误判为模型责任,而IEC协议与人工归因的一致性达到 Cohen's kappa 0.77(Table 5)。
      3. 在固定动作回放下,IntAct恢复了IEC-Bench中79.2%发生调用变更的失败任务(Table 1);带智能体闭环测试中,将通过任务的平均Token消耗降低2.4倍(Table 7)。
    • 作者结论与启示:作者认为工具调用能否正确执行主要取决于启动路径而非大模型本身,智能体框架必须按跃点顺序开展逐跳工程测试,同时基准评测应固定并报告启动路径以保证模型评分的公平性。
    完整解读
  4. 防御arXiv:2610.06966 ·

    APEX:在 LLM Agent 执行边界主动防御间接提示注入

    提出APEX,在执行边界以授权契约拦截智能体间接提示注入

    测试
    DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-sol 等 4 个应用层
    场景
    AI Agent
    摘要APEX在执行边界基于预编译授权契约实施证据门控与欺骗探针,在多基准上达成近零ASR。

    APEX 针对集成 Tools、MCP 与 Skills 的 LLM 智能体面临的间接提示注入威胁,提出将防御收敛至动作与输出最终交付的执行边界。

    完整解读
  5. 防御arXiv:2610.05640 ·

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    提出multi-CaMeL,在多智能体调用边界隔离可信指令与不可信数据

    测试
    Claude Fable 5、GPT-5.5、GPT-4.1 等 6 个应用层
    摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
    • 论文定位:这是一项针对分层多智能体系统在间接提示注入威胁下的安全性与防御协议研究。
    • 核心问题:现有单智能体系统级防御(如 CaMeL)无法在多智能体交互中自动组合,上游智能体获取的非可信数据经跨边界传递后会被下游智能体的规划模型视为可信输入,从而发生“边界清洗”并劫持系统控制流。
    • 防御方法:提出 multi-CaMeL 通信协议与扩展解释器,将跨智能体调用强制解耦为可信指令通道(message)与不透明数据通道(variables),在运行时维持指令通道完整性与数据溯源。
    • 核心实验结果:
      • 在 MultiAgentDojo 上,multi-CaMeL 将 5 款模型的平均攻击成功率从无防御的 12.9% 和单智能体 CaMeL 的 0.2% 降低至 0.0%,消除了残留攻击(Table III)。
      • 在良性效用上,AssetOpsBench 中 multi-CaMeL 较单智能体 CaMeL 平均仅多损失 3.2 个百分点,在 Claude Fable 5 与 GPT-5.5 上额外损失仅 0.85 个百分点(Figure 5)。
      • 效用损失随着模型能力的提升而呈现收窄趋势,作者称这提示能力更强的模型更能适应预定义控制流与变量解耦的约束(Figure 5、Figure 6)。
    • 作者结论与启示:作者指出“跨越智能体边界不得隐式提升信息的可信度”是多智能体安全的核心原则;单纯保护每个个体智能体并不足以保障系统安全,必须在系统交互接口处对指令与数据实施显式隔离。
    完整解读
  6. 防御arXiv:2610.04504 ·

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    提出VAL框架并用确认门与参数沙箱约束高风险工具调用

    测试
    DeepSeek-chat、Meta Llama 3.1 8B、Kimi应用层
    场景
    AI Agent
    摘要论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。
    • 一句话定位:论文应用验证自主权等级(VAL)剖析 LLM 智能体防御,揭示表面相同的 0.000 ASR 背后的结构保证与行为运气之别。
    • 要解决的问题:现有智能体防御缺乏解释其保证来源的统一坐标轴,经验测试下的零成功率无法预示防御在面对新攻击或不同环境时的真实效力。
    • 方法要点:依据规范来源将防御划分为 L0(模型自声明)至 L5(通用完备),主张锚点决定防御失效边界;在同等预算下构建由确认门(L1/L2)与参数沙箱(L3)构成的 VAL 结构栈,对比提示词硬化(L0)与关键词过滤(L1)构成的直觉栈。
    • 核心实验结果:在自建测试集上,VAL 栈实现 0.000 ASR 并保持 1.000 良性成功率,直觉栈虽同获 0.000 ASR 但良性成功率降为 0.000(两者差异在 p < 0.001 下显著);在 AgentDojo 银行套件上,VAL 栈将 ASR 降至 0.5%(无防御为 4.3%),直觉栈 ASR 漂移至 1.9%;在 7 轮升级攻击中,确认门即使被诱导顺从 83.3% 仍实现完全阻断。
    • 作者结论与启示:作者认为零攻击成功率只是测试结果而非理论保证,直觉防御依赖模型情绪且极易破坏实用性,而智能体安全的有效防线在于限制动作空间的结构隔离(L3)而非开放语义判断。
    完整解读
  7. 防御arXiv:2609.12001 ·

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    提出OATS,用确定性解析器在运行时治理技能动作

    测试
    Claude Sonnet 5、GPT-5.5、gpt-5-mini 等 4 个应用层
    摘要论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。
    • 定位与核心问题:本研究针对AI智能体技能生态中“发布时恶意检测”无法解决“具体机器上运行时权限许可”的问题,论证了动作级运行时控制的必要性并设计了轻量级防御系统。
    • 方法架构:作者设计了OATS运行时控制门,核心包含一个67.6 ms端到端延迟的确定性解析器(将shell命令映射到33个后果类,对无匹配项兜底拦截,决策路径无模型),一个基于(资源,后果类)二元组的分车道信任账本(13个高危类永不晋升),以及基于零失误二项分布反演的操作员风险容忍度晋升阈值模型。
    • 关键发现一:良性与许可的正交性:在ClawHub的66,192个技能中,29,257个被所有扫描器和法官评为clean的技能里,有705个技能(来自135家独立发布商)包含CIS Control 2.7等规范禁止的未授权或远程执行指令,人工审计显示其精确率为92.0%且无恶意意图标记。
    • 关键发现二:静态审查与动态执行脱节:在Claude Sonnet 5实机运行的39个clean技能中,仅1.4%的执行命令与文档字面完全一致,34.7%的命令后果类别从未在文档代码块中出现;在53个包含违规指令的clean技能中,智能体在23个技能里实际发起了违规操作,OATS对这23次动作实现了100%拦截或挂起。
    • 关键发现三:单命令防御的边界:在语义保持重写对抗基准上,解析器对包装与链式调用的识别率为100%,但在跨命令拆解、引号混淆等手段下整体宏平均解析率仅为52%,显示出无状态单命令匹配的局限。
    • 作者结论与启示:作者认为发布前制品扫描与运行时动作控制属于正交互补层,分别回答“制品是否恶意”与“操作是否许可”,任何一层均无法单独解决智能体安全问题;应将注册表扫描结果作为运行时账本的输入而非竞争替代品。
    完整解读
  8. 防御arXiv:2610.02664 ·

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    提出STAR-Guard双层防御缓解长程智能体遗忘安全约束

    测试
    GPT-5.5、DeepSeek-V4-Pro、GLM-5.2 等 7 个应用层
    场景
    AI Agent
    摘要揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。
    1. 针对长程工具使用智能体在多轮良性交互中遗忘先前安全约束的失效现象,形式化定义了跨轮安全约束忽略治理危害(GHOST),并构建了可执行评测基准 SCARBench。
    2. 核心问题在于智能体在多轮对话中能够恢复历史任务,但早先设定的前置要求或操作禁令容易脱离治理,导致不可逆的违规执行。
    3. 理论分析表明,若残留条件违规风险存在非可和下界,智能体轨迹几乎必然进入危险区域;据此提出 STAR-Guard 防御框架,耦合在线约束解析语义恢复与运行时确定性审计拦截。
    4. SCARBench 评测显示,在良性长上下文中 GPT-5.5 的严格 GHOST 率达 11.5%,Qwen3.5-4B 达 27.8%(Table 1);长历史在所有模型上均放大了安全约束恢复损失(Figure 3)。
    5. 引入 STAR-Guard 后,GPT-5.5 的安全完成率从 76.3% 提升至 94.0%,且未出现任何违规完成与 GHOST 事件(Table 2);在 Qwen3.5-4B 上将安全完成率由 47.0% 提高到 81.2%,显著超越各非 Oracle 基线。
    6. 作者认为,上下文增长会实质性削弱长程智能体对历史安全约束的治理效能,仅靠通用大模型检索或提示提醒难以保障安全,需将概率性语义恢复与执行前确定性规则屏障相结合。
    完整解读
  9. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
  10. 防御arXiv:2609.38983 ·

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    提出Approval Token绑定编程智能体的审批与执行

    测试
    Claude Code (v2.1.197, opus[1m] / claude-sonnet-5-ccmax)、Codex CLI (@openai/codex v0.154.0)应用层
    摘要系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。
    • 核心定位:该研究系统分析并测试了 AI 编程智能体套件中人类审批与底层工具执行之间的凭证绑定完整性断裂问题。
    • 问题剖析:当前套件假定人类批准动作与实际执行动作等价,但在六个凭证表面(范围、参数、会话、工具、委托身份及审批渲染)上,这一假设会因套件匹配逻辑或系统级副作用被静默破坏,导致无需重新审批即可派发越权操作。
    • 核心设计:作者构建了审批洗白六维分类学,提出基于 HMAC-SHA256 的七字段带密钥权能凭证 Approval Token,通过 PreToolUse 钩子对准入字段进行调用级拦截与重验。
    • 关键实验结果:
      • 基线评测中,Claude Code 在 Scope、Temporal(BGR 均为 1.000)和 Delegation(BGR = 0.947)上表现出高频洗白失效,Argument 洗白发生率为 0.450,PATH 劫持工具洗白达到 1.000,仅跨工具名替换被原生拦截(BGR = 0.000)。
      • 防御评估中,Approval Token 在 118 次离线重放中将 Delegation 和 Temporal 洗白降至 0.000(p < 0.0001),并在 6/6 实时测试中完成拦截;但因仅检查字段记录,对通过子进程和钩子触发的效果偏离(Scope 和 Argument)完全无法消除。
    • 启示与结论:作者指出单纯依赖工具调用边界的字段比对无法防范环境级副作用引起的执行偏离,工具安全机制必须向执行环境初始效果验证深化;同时对 Codex CLI 的探测揭示部分无头套件完全缺乏调用级审批抽象。
    完整解读
  11. 防御arXiv:2609.14003 ·

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个应用层
    场景
    AI Agent
    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。
    • 研究定位:该研究针对个人大模型智能体在协作交互中的隐私保护问题,揭示了依赖提示词进行内部推理防御的结构性脆弱性,并提出了基于信息流控制的系统层防御。
    • 核心问题:现有防御将隐私判断交由智能体在攻击者可控的对话上下文中进行,使得防御执行点与攻击面重合,攻击者可通过任务重构(CWL)、省略披露(SOA)和跨通道解耦(CDA)绕过检查。
    • 防御机制:FLOWSEAL基于数据溯源对敏感记录打标,在工具调用边界部署独立代码拦截器执行三级格策略,并借助隔离的LLM内容检查器做语义去分类,辅以协作API引导智能体正常交互。
    • 关键实验结果:在SPR基准(DeepSeek-V3.2)上,FLOWSEAL将CWL的条目泄漏率从SPR-D2的52.2%降至0.5%,SOA从75.6%降至2.3%,CDA从43.8%降至2.2%;良性任务实用率保持在72.4%;在真实Gmail与Notion的MCP测试中将SOA泄漏率降至0.0%。
    • 消融与开销:工具拦截器是防御核心(禁用后CWL泄漏率回升至28.4%);相较无防御设置,FLOWSEAL每轮仅增加0.017美元成本与37%的延迟。
    • 作者结论与启示:作者认为,通过将安全执行移至对抗性重构无法触及的外部层,智能体可以获得更稳定的隐私保护,未来需推动操作系统、工具层与模型对齐的多层纵深防御。
    完整解读
  12. 防御arXiv:2609.18411 ·

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    提出VAC,用真实操作参数与来源隔离保护智能体浏览器确认

    测试
    gpt-oss-120b、Gemini-2.5-Flash、GPT-4.1 等 6 个应用层
    摘要论文针对人在回路弹窗易受骗问题,提出提取 DOM 真实参数的外置验证卡 VAC,在跨模型评测中将攻击成功率完全归零。
    • 定位与核心问题:论文针对智能体浏览器在处理网页时容易遭遇提示注入并被操纵为混淆代理的问题,指出当前主流的“人在回路”确认弹窗因依赖模型生成摘要或页面可控标签,易受 Lies-in-the-Loop 伪造,无法提供安全保证。
    • 架构方案设计:提出了可验证操作卡(Verifiable Action Card, VAC),将安全根基从模型叙述转移至底层动作本身。核心包括:从 DOM 待执行表单中提取真实的收件人、金额与目标域名的操作描述符(C2);在浏览器可信 chrome 中渲染默认拒绝的独立卡片(C3);通过结构特征与意图来源进行风险分级(C4);并在动作分发瞬间重新校验参数以防范 TOCTOU 篡改(C5)。
    • 主要实验结果:
      1. 在跨 5 个开源模型的评测中,无门控时攻击成功率平均为 78%(各模型介于 68% 至 100%),VAC 将所有模型的攻击成功率降至 0%(Table 8、10)。
      2. 朴素人在回路(Naive HITL)面对伪造标签时攻击成功率仍高达 72%,在转账伪造场景下被骗率达 100%,而 VAC 在相同条件下将 ASR 降至 0%(Table 10、第 8.1 节)。
      3. VAC 在 293 次评测中保持了 78% 的良性任务完成率,误报拦截率为 0%,平均每个良性任务仅需 0.94 次确认(Table 10)。
      4. 面对提交时篡改参数的自适应 TOCTOU 攻击与虚假归因攻击,无门控与 Naive HITL 均告失守,VAC 借助执行绑定与域名级归因实现了拦截(Table 9)。
    • 作者结论与启示:作者认为,人机协同防御的有效性完全取决于呈现给人类的证据质量;将确认逻辑绑定至真实动作并脱离模型与页面渲染信道,为自主智能体提供了不受模型鲁棒性波动影响的系统级安全防线。
    完整解读
  13. 防御arXiv:2609.35932 ·

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    证明保留词元表示放大模板注入并验证分词缓解

    测试
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B-Instruct 等 6 个应用层
    场景
    AI Agent
    摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。
    • 核心定位与问题:针对大模型智能体中对话模板伪造攻击的有效性机理,论文在严格固定输入字节的前提下,首次将保留控制词元 ID 与模板文本外观的贡献解耦并定量测量。
    • 核心方法设计:提出固定字节对比框架,通过服务端分词控制保留词元与普通子词切分,并引入词元数补偿对照组(Matched)定义标识差距 Δ,结合输入嵌入层向量替换实施因果归因。
    • 关键实验结果:
      • 在 Llama-3.1、GLM-4.5 和 Seed-OSS-36B 上,去除保留词元使 InjecAgent 攻击成功率降低 39.3 至 65.5 个百分点,证实保留表示主导攻击威力(Table 2)。
      • 保留标记的权威性根植于标记位置的单个学得向量,Llama-3.1-8B 替换为嵌入空间最近普通词元向量可恢复 98.4% 成功率(Table 4)。
      • Qwen3-8B 具有文本语法主导特性,但在关闭思考块后,去除保留词元的攻击成功率从 74.7% 跌至 35.7%,标识差距扩大至 49.8 个百分点(Table 27)。
      • 普查发现 64% 的主流开源模型分词器未覆盖工具协议词元,且自适应嵌入邻近搜索可恢复大部分攻击成功率(Table 31, Table 32)。
    • 作者结论与启示:作者认为对话模板注入攻击的权威性主要来自模型后训练中对保留控制向量赋予的学习信号;安全研究与防御部署必须深入分词器底层并审查传递给模型的具体词元 ID。
    完整解读
  14. 防御arXiv:2609.34518 ·

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击DART与预执行防御SAGE

    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个应用层
    场景
    AI Agent
    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
    • 论文定位:该研究从部分可观测状态控制视角研究基于工具调用的语言模型智能体安全,提出了状态控制形式化框架 SEAD 及相应的攻击方法 DART 与预执行防御方法 SAGE。
    • 面临的核心问题:在工具智能体中,攻击者可将危害拆解为看似良性的多步操作,危害最终体现为外部环境状态的持久改变;而各角色仅具有部分可观测性,缺乏环境状态证据导致无法区分合法准备操作与有害越界。
    • 核心方法设计:攻击方法 DART 在已执行前缀树上展开搜索,利用工具执行的真实环境反馈指导分支扩展;防御方法 SAGE 在待执行动作生效前介入,通过有限步私有只读环境查询获取状态证据,消除状态歧义后再做放行或拦截决策。
    • 关键实验结果:在 187 个恶意任务上,DART 在 4 个目标模型上的 Semantic ASR 达到 43.9%–73.3%,Hard ASR 达到 33.2%–54.7%,较对应最佳基线分别提升 18.8–35.9 和 8.1–17.9 个百分点(Table 2);在 75 任务子集的离线评测中,SAGE 取得 95.79% 的良性通过率与 34.55% 的精确闭环拦截率,综合指标 F1 达 50.78%、F2 达 72.86%(Table 3);在线防御中,SAGE 将 DART 对 GPT-5.6 Luna 的 Hard ASR 从 48.0% 降至 4.0%(Figure 3),并在未参与训练的 PostgreSQL 与 Web 任务中展现出跨领域防御能力(Table 5)。
    • 作者结论与启示:作者认为,工具调用将智能体安全转化为围绕关键状态转移的部分可观测控制问题;单纯依赖对话语义或孤立动作难以可靠判断危害,将环境状态证据与执行反馈纳入攻防闭环是提升智能体安全评估与防御能力的关键路径。
    完整解读
已经到底了