跳到正文
10月8日 · 周四

红队 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
  2. 防御arXiv:2609.35932 ·

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    证明保留词元表示放大模板注入并验证分词缓解

    测试
    Qwen3-8B、Qwen3-32B、Llama-3.1-8B-Instruct 等 6 个应用层
    场景
    AI Agent
    摘要对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。
    • 核心定位与问题:针对大模型智能体中对话模板伪造攻击的有效性机理,论文在严格固定输入字节的前提下,首次将保留控制词元 ID 与模板文本外观的贡献解耦并定量测量。
    • 核心方法设计:提出固定字节对比框架,通过服务端分词控制保留词元与普通子词切分,并引入词元数补偿对照组(Matched)定义标识差距 Δ,结合输入嵌入层向量替换实施因果归因。
    • 关键实验结果:
      • 在 Llama-3.1、GLM-4.5 和 Seed-OSS-36B 上,去除保留词元使 InjecAgent 攻击成功率降低 39.3 至 65.5 个百分点,证实保留表示主导攻击威力(Table 2)。
      • 保留标记的权威性根植于标记位置的单个学得向量,Llama-3.1-8B 替换为嵌入空间最近普通词元向量可恢复 98.4% 成功率(Table 4)。
      • Qwen3-8B 具有文本语法主导特性,但在关闭思考块后,去除保留词元的攻击成功率从 74.7% 跌至 35.7%,标识差距扩大至 49.8 个百分点(Table 27)。
      • 普查发现 64% 的主流开源模型分词器未覆盖工具协议词元,且自适应嵌入邻近搜索可恢复大部分攻击成功率(Table 31, Table 32)。
    • 作者结论与启示:作者认为对话模板注入攻击的权威性主要来自模型后训练中对保留控制向量赋予的学习信号;安全研究与防御部署必须深入分词器底层并审查传递给模型的具体词元 ID。
    完整解读
已经到底了