跳到正文
10月8日 · 周四

红队 · 论文

找到 6 篇
  1. 防御arXiv:2610.05163 ·

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    提出PAA路径对齐归因,审计编程智能体边界动作前的分段提示注入

    测试
    Codex CLI (v0.144.0, GPT-5.5)、GPT-5.5、GPT-5.6-Sol 等 7 个应用层
    摘要论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。

    完整解读
  2. 防御arXiv:2610.03089 ·

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出COBRA双LLM架构,防御计算机使用智能体的分支转向攻击

    测试
    gpt-5、UI-TARS-1.5-7B、claude-sonnet-5 等 6 个应用层
    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
    • 论文定位:论文针对计算机使用智能体(CUA)在处理动态网络内容时面临的分支转向攻击,提出了首个系统性评测基准 STEER-Bench 以及结合控制流与数据流防御的系统级架构 COBRA。
    • 面临的核心问题:现有的 Dual-LLM 架构通过离线特权规划器提供控制流完整性(CFI),但无法应对动态图形界面所必需的运行时分支;攻击者无需注入新的指令,仅需操纵页面数据即可诱导智能体执行危险的预批准分支,造成数据流完整性(DFI)失效。
    • 方法核心设计:COBRA 在接触不可信内容前由规划器(P-LLM)将任务与经 SHA-256 钉住的站点/工具元数据编译为带约束的分支程序,隔离的 Q-VLM 仅负责视觉感知;运行时由分支解析中枢(BRH)动态验证分支条件与参数,并通过确定性 HTTP 和 MCP 代理在网络与工具边界严格阻断越权操作;同时结合多样本融合规划与站点描述生成工具 MESA 辅助部署。
    • 关键实验结果:
      • 在 STEER-Bench 的 199 个攻击单元格中,完整 COBRA 将分支转向攻击成功率(ASR)降至 0%(标准 ReAct 为 94.4%,Vanilla Dual-LLM 为 89.5%),同时保留 97% 的良性效用。
      • 在 4 个外部安全基准中,COBRA 在其威胁模型涵盖的 1,259 个攻击案例上均实现 0% ASR。
      • 在 OSWorld-MCP 361 个任务上,gpt-5 与 UI-TARS-1.5-7B 组合的 COBRA 取得 36.8% 的任务完成率,优于 UI-TARS-1.5-7B 单模型 ReAct 基线的 23.5%。
    • 作者的结论与启示:作者认为,保护 CUA 必须从控制流完整性拓展到严格的数据流完整性控制;未来在处理未进入网络请求的视觉数值、自由文本语义、非 HTTP 本地协议以及依赖站点所有者发布描述等方面仍存在开放挑战。
    完整解读
  3. 防御arXiv:2608.06422 ·

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    提出分片监督,将评判标准拆至独立调用以改善一致性并抵御展示攻击

    测试
    ChatGPT、Claude Opus 4.8、Claude Sonnet 4.6 等 5 个应用层
    场景
    LLM 应用攻击者黑盒
    摘要论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。

    完整解读
  4. 评测与基准arXiv:2609.19587 ·

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    红队评估编码智能体的阻断监视器,并提出Auto Mode++加固

    测试
    GPT 5.6 Luna、Opus 5、Opus 4.8 等 8 个应用层
    摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
    • 定位与核心问题:本研究系统评估了生产级代码智能体阻断监视器在面对具有持续对抗意图的智能体时的表现,重点关注防止智能体造成外发权重等不可逆灾难性破坏的能力。
    • 方法与防御设计:研究梳理出监视器注入、多上下文攻击、覆盖漏洞和策略失效四类攻击形态;针对上述隐患,作者提出了包括heredoc轮次隔离、Unicode转义、强制监控工作目录编辑、压缩摘要意图审查以及三阶段分层审查在内的Auto Mode ++防御方案。
    • 主要实验发现:
      • 在基准评估中,生产环境默认的Auto Mode和Guardian在Opus 5攻击下四类攻击平均ASR分别达65%和72%(Figure 1)。
      • 注入攻击在扁平化文本渲染下呈现较高失效率,攻击者利用换行伪造可使Auto Mode的注入ASR达78.4%,而采用heredoc框架与转义的Auto Mode ++将其抑制至1.6%(Figure 5a)。
      • 动作碎片化攻击效果明显,随着多智能体协同数量由2个增至20个,Opus 5的ASR由约30%提升至88%;单智能体恶意压缩20次后ASR升至85%(Figure 7)。
      • Auto Mode ++将四类攻击平均ASR由65%降低至9%(Figure 1),同时在4,000个良性SWE-chat动作上保持误报率低于1%、单步延迟约1.2秒(Figure 8)。
    • 作者启示与结论:作者认为针对单步注入与工作目录覆盖漏洞的工程防御成本较低且具有防御效果;然而,防范跨越会话与压缩边界的多上下文攻击必须依赖具备全局上下文感知能力的智能体审查,这与交互式部署的延迟要求存在固有张力,在可接受成本下防范多上下文攻击仍是一个开放问题。
    完整解读
  5. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    GPT-4.1、OpenAI Codex、Llama-3.1-8B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  6. 防御arXiv:2609.34518 ·

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击DART与预执行防御SAGE

    测试
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 8 个应用层
    场景
    AI Agent
    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。
    • 论文定位:该研究从部分可观测状态控制视角研究基于工具调用的语言模型智能体安全,提出了状态控制形式化框架 SEAD 及相应的攻击方法 DART 与预执行防御方法 SAGE。
    • 面临的核心问题:在工具智能体中,攻击者可将危害拆解为看似良性的多步操作,危害最终体现为外部环境状态的持久改变;而各角色仅具有部分可观测性,缺乏环境状态证据导致无法区分合法准备操作与有害越界。
    • 核心方法设计:攻击方法 DART 在已执行前缀树上展开搜索,利用工具执行的真实环境反馈指导分支扩展;防御方法 SAGE 在待执行动作生效前介入,通过有限步私有只读环境查询获取状态证据,消除状态歧义后再做放行或拦截决策。
    • 关键实验结果:在 187 个恶意任务上,DART 在 4 个目标模型上的 Semantic ASR 达到 43.9%–73.3%,Hard ASR 达到 33.2%–54.7%,较对应最佳基线分别提升 18.8–35.9 和 8.1–17.9 个百分点(Table 2);在 75 任务子集的离线评测中,SAGE 取得 95.79% 的良性通过率与 34.55% 的精确闭环拦截率,综合指标 F1 达 50.78%、F2 达 72.86%(Table 3);在线防御中,SAGE 将 DART 对 GPT-5.6 Luna 的 Hard ASR 从 48.0% 降至 4.0%(Figure 3),并在未参与训练的 PostgreSQL 与 Web 任务中展现出跨领域防御能力(Table 5)。
    • 作者结论与启示:作者认为,工具调用将智能体安全转化为围绕关键状态转移的部分可观测控制问题;单纯依赖对话语义或孤立动作难以可靠判断危害,将环境状态证据与执行反馈纳入攻防闭环是提升智能体安全评估与防御能力的关键路径。
    完整解读
已经到底了