跳到正文
10月8日 · 周四

红队 · 论文

精选论文 54 篇
  1. 防御arXiv:2610.04504 · 53

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    论文用VAL框架对比防御,在自建测试集上VAL栈获0.000 ASR且保持1.000良性效用,直觉栈良性效用为0。

    • 0.000DeepSeek自建集静态攻击VAL栈(V)的ASR(据表6)
    • 0.000DeepSeek自建集静态攻击直觉栈(N)良性成功率(据表6)
    • 0.5%DeepSeek在AgentDojo银行套件VAL栈ASR(据表6.5)
    6 问速览论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。
    1. 这篇论文试图解决什么问题?

      论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。

    2. 有哪些相关研究?

      论文梳理了验证自治等级、文本与工具级防御以及智能体评测基准,将本文定位为先验分类坐标轴。

    3. 论文如何解决这个问题?

      通过扩展VAL规则分级防御,并构建确认门与参数沙箱组合的结构栈,以平台记录和形式规范约束动作。

    4. 论文做了哪些实验?

      实验在自建集和AgentDojo等多基准上对比结构栈与直觉栈,揭示相同零值背后的效用鸿沟与稳定性差异。

    5. 有什么可以进一步探索的点?

      作者指出了受害者模型较少、评定者无人类参与等局限;实验覆盖了三个模型和多个基准测试套件。

    6. 总结一下论文的主要内容

      论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。

    完整解读
  2. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  3. 防御arXiv:2610.03089 · 53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。

    • 0%STEER-Bench 全部 199 个攻击单元格,完整 COBRA 系统的 ASR
    • 97%STEER-Bench 138 个良性单元格,COBRA 相比 Dual-LLM 保留的良性效用
    • 89.5%STEER-Bench 74 个通用智能体单元格,Vanilla Dual-LLM 基线的 ASR
    6 问速览动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
    1. 这篇论文试图解决什么问题?

      动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。

    2. 有哪些相关研究?

      梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。

    3. 论文如何解决这个问题?

      提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。

    4. 论文做了哪些实验?

      在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。

    5. 有什么可以进一步探索的点?

      作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。

    6. 总结一下论文的主要内容

      提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    完整解读
  4. 防御arXiv:2608.06422 · 54

    CMU 研究:分片判断可避免 LLM 监督失效并抵御对抗利用

    分片机制将多项标准分配给独立调用,在相同总预算下改善评判模型与专家的一致性,并防御展示攻击。

    • 0.789PaperBench 116项标准,Opus 4.8分片评判kappa值(Table S19)
    • 0.598PaperBench 116项标准,Opus 4.8全预算单调用kappa值(Table S19)
    • 0.261PaperBench pinn模板,Opus 4.8在N=8攻击下的过接受率降幅(Table S20)
    6 问速览单次调用承担过多判定任务会导致注意力瓶颈和决策失据,产生可被展示变化操纵的脆弱性,分片机制旨在解决该过载问题。
    1. 这篇论文试图解决什么问题?

      单次调用承担过多判定任务会导致注意力瓶颈和决策失据,产生可被展示变化操纵的脆弱性,分片机制旨在解决该过载问题。

    2. 有哪些相关研究?

      论文围绕可扩展监督、大模型评判偏差、奖励过度优化与分解验证四类研究展开,并与全预算单调用等基线严格对照。

    3. 论文如何解决这个问题?

      论文将多项评估标准切分为不相交的分片子集独立评判,并在面对自适应攻击时在分片内加入对立辩护人提供平衡论据。

    4. 论文做了哪些实验?

      实验覆盖研究复现、法律、临床试验和代码等多个基准,证实分片能改善专家一致性并防御展示攻击,而辩论能抵御自适应攻击。

    5. 有什么可以进一步探索的点?

      论文指出分片在模型已有处理容量的场景下无额外收益,且自适应防御引入了假拒绝代价,实验评测集中在特定模型与任务中。

    6. 总结一下论文的主要内容

      论文揭示决策负载是大模型监督的独立瓶颈,提出分片与辩论机制有效分离注意力与平衡证据,在多项高难度基准上实现稳健评判。

    完整解读
  5. 防御arXiv:2609.35932 · 57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    研究者在固定字节下评测对话模板注入,发现去除保留词元使Llama-3.1等模型ASR降低39-66个百分点,权威性源于单个向量。

    • +58.2 ppLlama-3.1-8B在InjecAgent直接危害上的标识差距Δ(Table 2)
    • +65.5 ppGLM-4.5在InjecAgent数据窃取上的标识差距Δ(Table 2)
    • +49.8 ppQwen3-8B抑制思考块后直接危害标识差距Δ(Table 27)
    6 问速览研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。
    1. 这篇论文试图解决什么问题?

      研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。

    2. 有哪些相关研究?

      梳理了间接提示注入评测、对话模板伪造攻击、分词对抗扰动以及指令数据分离防御四类相关研究,指明本文固定字节解耦视角。

    3. 论文如何解决这个问题?

      通过固定字节下的保留与子词切分对比,引入词元数补偿对照定义标识差距,结合向量替换因果干预与来源感知分词器验证防御。

    4. 论文做了哪些实验?

      在两项基准上验证了保留词元向量的主导作用,揭示了思考推理的补偿效应、工具协议词元防御缺口及自适应嵌入搜索威胁。

    5. 有什么可以进一步探索的点?

      作者指出了开源自托管范围、工具调用解析判定标准与输入层干预三项局限,其实验覆盖了六个开源模型与两大评估基准。

    6. 总结一下论文的主要内容

      对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    完整解读
  6. 防御arXiv:2609.34518 · 56

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    论文提出攻击DART与防御SAGE,在GPT-5.6 Luna上将DART的Hard ASR从48.0%降至4.0%。

    • 54.7%GPT-5.6 Luna在187任务上DART的Hard ASR(Table 2)
    • 73.3%GPT-5.6 Luna在187任务上DART的Semantic ASR(Table 2)
    • 95.79%SAGE在95条OAS良性轨迹上的全通过率B(Table 3)
    6 问速览针对工具智能体中多步操作累积危害且环境状态部分可观测的问题,论文提出状态控制框架及攻击 DART 与防御 SAGE。
    1. 这篇论文试图解决什么问题?

      针对工具智能体中多步操作累积危害且环境状态部分可观测的问题,论文提出状态控制框架及攻击 DART 与防御 SAGE。

    2. 有哪些相关研究?

      论文围绕智能体自适应攻击与运行时动作防御展开,指出现有方法缺少状态演化视角,本文引入执行反馈与环境探测。

    3. 论文如何解决这个问题?

      通过将执行循环建模为状态控制,DART 利用执行前缀树搜索自适应攻击,SAGE 则结合私有只读环境探测进行门控拦截。

    4. 论文做了哪些实验?

      DART 在四种目标模型上均取得最高攻击成功率,SAGE 实现 95.79% 良性放行与 50.78% F1,在线将 Hard ASR 降至 4.0%。

    5. 有什么可以进一步探索的点?

      作者指出现有干预接口尚未覆盖并发与复合动作,并提出需进一步探索查询终止时机与证据复用机制。

    6. 总结一下论文的主要内容

      论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    完整解读
已经到底了