跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
  2. 防御arXiv:2609.18411 ·

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    提出VAC,用真实操作参数与来源隔离保护智能体浏览器确认

    测试
    gpt-oss-120b、Gemini-2.5-Flash、GPT-4.1 等 6 个应用层
    摘要论文针对人在回路弹窗易受骗问题,提出提取 DOM 真实参数的外置验证卡 VAC,在跨模型评测中将攻击成功率完全归零。
    • 定位与核心问题:论文针对智能体浏览器在处理网页时容易遭遇提示注入并被操纵为混淆代理的问题,指出当前主流的“人在回路”确认弹窗因依赖模型生成摘要或页面可控标签,易受 Lies-in-the-Loop 伪造,无法提供安全保证。
    • 架构方案设计:提出了可验证操作卡(Verifiable Action Card, VAC),将安全根基从模型叙述转移至底层动作本身。核心包括:从 DOM 待执行表单中提取真实的收件人、金额与目标域名的操作描述符(C2);在浏览器可信 chrome 中渲染默认拒绝的独立卡片(C3);通过结构特征与意图来源进行风险分级(C4);并在动作分发瞬间重新校验参数以防范 TOCTOU 篡改(C5)。
    • 主要实验结果:
      1. 在跨 5 个开源模型的评测中,无门控时攻击成功率平均为 78%(各模型介于 68% 至 100%),VAC 将所有模型的攻击成功率降至 0%(Table 8、10)。
      2. 朴素人在回路(Naive HITL)面对伪造标签时攻击成功率仍高达 72%,在转账伪造场景下被骗率达 100%,而 VAC 在相同条件下将 ASR 降至 0%(Table 10、第 8.1 节)。
      3. VAC 在 293 次评测中保持了 78% 的良性任务完成率,误报拦截率为 0%,平均每个良性任务仅需 0.94 次确认(Table 10)。
      4. 面对提交时篡改参数的自适应 TOCTOU 攻击与虚假归因攻击,无门控与 Naive HITL 均告失守,VAC 借助执行绑定与域名级归因实现了拦截(Table 9)。
    • 作者结论与启示:作者认为,人机协同防御的有效性完全取决于呈现给人类的证据质量;将确认逻辑绑定至真实动作并脱离模型与页面渲染信道,为自主智能体提供了不受模型鲁棒性波动影响的系统级安全防线。
    完整解读
已经到底了