跳到正文
10月8日 · 周四

Agent 安全 · 论文

精选论文 133 篇
  1. 防御arXiv:2610.09793 · 61

    用时序逻辑监控工具 Agent:MonPoly 标出 71.8% STAC 攻击链,但溯源检查被一行注入骗过 94%–99%

    在AgentDojo与STAC上离线重放时序验证,通用规约检出超70%攻击但良性触发率达29.3%,强化溯源可防历史投毒。

    • 70.1%AgentDojo上GPT-4o无防御成功攻击的通用规约检出率(Table 1)
    • 29.3%AgentDojo上GPT-4o良性运行的通用规约良性触发率(Table 1)
    • 71.8%STAC基准全部483条攻击链隐匿最终步的规约检出率(Section 4.1)
    6 问速览研究工具调用智能体多步安全策略的形式化时序验证及现有基准支撑能力。
    1. 这篇论文试图解决什么问题?

      研究工具调用智能体多步安全策略的形式化时序验证及现有基准支撑能力。

    2. 有哪些相关研究?

      梳理了智能体护栏、攻击评测基准与时序验证工具,强调本文立足离线重放。

    3. 论文如何解决这个问题?

      将轨迹映射为事件流并采用MFOTL与强化溯源机制进行离线验证。

    4. 论文做了哪些实验?

      通用规约检出超70%但误报近30%,参数化与强化溯源显著优化区分度。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放与语义盲区局限,度量时序仅在合成日志验证。

    6. 总结一下论文的主要内容

      形式化验证可有效识别多步攻击,但其有效性高度依赖轨迹的可信历史记录。

    完整解读
  2. 防御arXiv:2609.11757 · 60

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    作者对AP2开展Whisper决策攻击与A-VIP防御,事实操纵在gemini-3.1-flash-lite达73.3%。

    • 90%gemini-2.5-flash-lite上Vault Whisper成功率(Table 3)
    • 56%gemini-2.5-flash-lite上Branded Whisper成功率(Table 3)
    • 73.3%gemini-3.1-flash-lite上Selection Whisper成功率(Table 3)
    6 问速览协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。
    1. 这篇论文试图解决什么问题?

      协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。

    2. 有哪些相关研究?

      现有研究涵盖智能体支付安全、提示注入基准及模型输入输出防御,但缺乏意图与决策的协议层绑定。

    3. 论文如何解决这个问题?

      A-VIP将意图视为权能授权,通过会话令牌解耦凭据、结构化比对绑定购物车,并对未授权超支触发确认。

    4. 论文做了哪些实验?

      评测覆盖17个Google模型及跨厂商模型,实测记录到事实操纵普遍有效,A-VIP成功拦截结构篡改。

    5. 有什么可以进一步探索的点?

      作者指出同价替换无法拦截、确认依赖用户审查及扫描器误报等局限,未来可探索多轮社工与密码学证明。

    6. 总结一下论文的主要内容

      论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。

    完整解读
  3. 防御arXiv:2610.07359 · 54

    论文实测 Agent 工具调用门控栈的失败相关性

    论文在三套语料上实测规则与LLM裁判,发现裁判间错误相关且等效层数仅1.2–1.4,跨机制组合达1.86–2.09层(STRICT)。

    • 1.22 to 1.44STRICT定义下任意两LLM裁判组合的等效层数区间(Table IV)
    • 1.86 to 2.09STRICT定义下规则层加一个LLM裁判的等效层数区间(Table IV)
    • +0.430STRICT定义下6组裁判对间相关系数phi中位数(Table III)
    6 问速览论文检验动作门禁堆叠中各层错误相乘的独立性假设,并评估各层对整栈的实际贡献。
    1. 这篇论文试图解决什么问题?

      论文检验动作门禁堆叠中各层错误相乘的独立性假设,并评估各层对整栈的实际贡献。

    2. 有哪些相关研究?

      论文梳理了防御堆叠故障关联、大模型协同错误、冗余工程及运行时拦截架构等相关研究。

    3. 论文如何解决这个问题?

      论文提出乘积等效层数指标nmult,并在脱敏设定下对规则与多模型裁判构建堆叠评测框架。

    4. 论文做了哪些实验?

      论文在汇聚语料与分项实验中测试了等效层数、单层增益背离、混淆假说及复核规则影响。

    5. 有什么可以进一步探索的点?

      作者指出机制采样单一、全栈删失及无人工层等局限,实验仅覆盖至特定语料及静态门禁。

    6. 总结一下论文的主要内容

      论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    完整解读
  4. 防御arXiv:2610.06966 · 53

    APEX:在 LLM Agent 执行边界主动防御间接提示注入

    APEX在执行边界基于预编译授权契约与探针防御间接提示注入,在5个基准上取得0% ASR,在SkillInject上为0.56%。

    • 0.00%AgentDojo基准下DeepSeek-V4-Flash的ASR(Table 1)
    • 0.00%ASB-OPI基准下DeepSeek-V4-Flash的ASR(Table 1)
    • 0.00%MCPTox基准下DeepSeek-V4-Flash的ASR(Figure 3 / Table 3)
    6 问速览在LLM智能体执行边界拦截由异构能力单元和组合攻击引入的未经授权动作与未背书信息使用。
    1. 这篇论文试图解决什么问题?

      在LLM智能体执行边界拦截由异构能力单元和组合攻击引入的未经授权动作与未背书信息使用。

    2. 有哪些相关研究?

      梳理了内容过滤、任务对齐、策略控制、数据溯源及蜜罐防御,指出其缺乏执行边界统一判定。

    3. 论文如何解决这个问题?

      通过预编译DAG授权契约,在执行边界以WRAP验证参数证据、PLANT检测探针并实现安全恢复。

    4. 论文做了哪些实验?

      在6个基准上对比13种基线,5个基准达成0% ASR,自适应攻击下均保持0% ASR。

    5. 有什么可以进一步探索的点?

      局限在于契约保真度依赖、动态委托支持不足及长视距编译挑战;实验覆盖3种模型与6个基准。

    6. 总结一下论文的主要内容

      APEX在执行边界基于预编译授权契约实施证据门控与欺骗探针,在多基准上达成近零ASR。

    完整解读
  5. 防御arXiv:2605.17380 · 54

    Uber 提出 ADR 企业级 Agent 检测系统,在 7200 台主机部署十个月

    Uber 团队提出企业级智能体检测系统 ADR,在 ADR-Bench 上实现零误报与 0.800 F1,并在生产部署中拦截凭据泄漏。

    • 0.800ADR,ADR-Bench,F1-score(Table 2)
    • 1.000ADR,ADR-Bench,Precision(Table 2)
    • 0.667ADR,ADR-Bench,Recall,检出 28/42(Table 2)
    6 问速览解决企业 MCP 智能体缺乏语义遥测、规则难以泛化及大模型全量检测成本高的问题。
    1. 这篇论文试图解决什么问题?

      解决企业 MCP 智能体缺乏语义遥测、规则难以泛化及大模型全量检测成本高的问题。

    2. 有哪些相关研究?

      梳理了智能体安全基准、智能体防御系统及自动化红队研究,指出其在 MCP 覆盖与自适应上的不足。

    3. 论文如何解决这个问题?

      通过 Sensor 重建因果遥测,结合 Tier 1/2 分级检测与 Explorer 进化红队实现闭环防护。

    4. 论文做了哪些实验?

      在 ADR-Bench 上达 0 误报与 0.800 F1,在 AgentDojo 达 0.962 F1,并完成了生产环境部署验证。

    5. 有什么可以进一步探索的点?

      作者指出需拓展多智能体与网关防护,实验覆盖了两个基准、三类基线与企业端点部署。

    6. 总结一下论文的主要内容

      提出了端点因果遥测、两级在线分流与离线红队闭环的 ADR 系统,并在生产环境中验证了有效性。

    完整解读
  6. 防御arXiv:2610.05640 · 55

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    论文提出 multi-CaMeL 防御,在 MultiAgentDojo 上将平均 ASR 从 12.9% 降至 0.0%。

    • 0.0%MultiAgentDojo 平均 ASR,multi-CaMeL(Table III)
    • 12.9%MultiAgentDojo 平均 ASR,No CaMeL(Table III)
    • 0.2%MultiAgentDojo 平均 ASR,单智能体 CaMeL(Table III)
    6 问速览单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。
    1. 这篇论文试图解决什么问题?

      单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。

    2. 有哪些相关研究?

      论文梳理了间接提示注入防御、多智能体协作与安全性、以及控制流完整性与信息流控制等方向的研究。

    3. 论文如何解决这个问题?

      提出 multi-CaMeL 协议,将智能体间调用拆分为可信指令与非可信变量两个通道,并由解释器在运行时保持溯源。

    4. 论文做了哪些实验?

      在 MultiAgentDojo 与 AssetOpsBench 上测试 5 款模型,multi-CaMeL 将 ASR 降至 0.0% 且效用代价较小。

    5. 有什么可以进一步探索的点?

      局限包括仅限树状拓扑、继承了 CaMeL 解释器的隐式依赖缺陷;未来可扩展至非树状架构并建立更强信息流保证。

    6. 总结一下论文的主要内容

      论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    完整解读
  7. 防御arXiv:2610.04504 · 53

    论文提出 VAL 框架:相同 ASR 的 LLM Agent 防御可能对应不同安全保证

    论文用VAL框架对比防御,在自建测试集上VAL栈获0.000 ASR且保持1.000良性效用,直觉栈良性效用为0。

    • 0.000DeepSeek自建集静态攻击VAL栈(V)的ASR(据表6)
    • 0.000DeepSeek自建集静态攻击直觉栈(N)良性成功率(据表6)
    • 0.5%DeepSeek在AgentDojo银行套件VAL栈ASR(据表6.5)
    6 问速览论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。
    1. 这篇论文试图解决什么问题?

      论文旨在解决智能体防御缺乏理论保证来源的问题,提出VAL框架以区分行为运气与结构约束。

    2. 有哪些相关研究?

      论文梳理了验证自治等级、文本与工具级防御以及智能体评测基准,将本文定位为先验分类坐标轴。

    3. 论文如何解决这个问题?

      通过扩展VAL规则分级防御,并构建确认门与参数沙箱组合的结构栈,以平台记录和形式规范约束动作。

    4. 论文做了哪些实验?

      实验在自建集和AgentDojo等多基准上对比结构栈与直觉栈,揭示相同零值背后的效用鸿沟与稳定性差异。

    5. 有什么可以进一步探索的点?

      作者指出了受害者模型较少、评定者无人类参与等局限;实验覆盖了三个模型和多个基准测试套件。

    6. 总结一下论文的主要内容

      论文证明相同ASR不等于相同安全保证,VAL结构栈在保持效用的同时提供超越模型行为运气的防御。

    完整解读
  8. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  9. 防御arXiv:2609.12001 · 57

    Pheo 提出 OATS:用确定性解析器在运行时治理 Agent 技能动作

    研究发现ClawHub有705个全clean技能含违规指令,实测34.7%命令后果类文档未记载,OATS拦截了全部违规尝试。

    • 705ClawHub四项扫描全clean但指示禁止操作的技能数(Table 2)
    • 92.0%人工抽检100个违规检出技能的Precision(95% CI [84.8%, 96.5%],§4)
    • 34.7%Claude Sonnet 5实测中后果类未在文档出现的命令占比(Table 3)
    6 问速览发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。
    1. 这篇论文试图解决什么问题?

      发布时恶意检测无法替代运行时动作许可控制,且文档静态分析无法约束智能体动态重构生成的实际执行操作。

    2. 有哪些相关研究?

      相关研究涵盖注册表扫描与供应链攻击、运行时LLM防护栏、系统引用监视器与轨迹保证,论文定位在动作级轻量拦截。

    3. 论文如何解决这个问题?

      设计确定性解析器映射命令后果类别,结合分车道信任账本与风险容忍度推导晋升阈值,在工具调用前无模型介入地判定操作。

    4. 论文做了哪些实验?

      在6.6万技能库及实机智能体中,测出705个clean技能含违规指令,智能体34.7%命令后果脱离文档,OATS拦截了全部违规动作。

    5. 有什么可以进一步探索的点?

      作者指出了非动作型危害盲区、单命令语法规避与依赖自审计等局限,实验也主要集中于单模型单日及单一注册表快照。

    6. 总结一下论文的主要内容

      论文论证了发布时恶意扫描无法替代运行时动作许可控制,提出了轻量确定性控制门OATS,展示了双层防御组合的必要性。

    完整解读
  10. 防御arXiv:2610.02664 · 53

    论文提出 GHOST:长程智能体在良性对话中遗忘早期安全约束,GPT-5.5 发生率 11.5%

    研究智能体跨轮遗忘约束的 GHOST,GPT-5.5 在 SCARBench 达 11.5% GHOST 率,双层防御降至 0。

    • 11.5%GPT-5.5 在 SCARBench 上的严格 GHOST 率(Table 1)
    • 27.8%Qwen3.5-4B 在 SCARBench 上的严格 GHOST 率(Table 1)
    • 0.0%STAR-Guard 防御下 GPT-5.5 在 SCARBench 的 GHOST 率(Table 2)
    6 问速览研究长程智能体在良性多轮交互中恢复任务时遗忘早期安全约束的 GHOST 失效模式与治理危害。
    1. 这篇论文试图解决什么问题?

      研究长程智能体在良性多轮交互中恢复任务时遗忘早期安全约束的 GHOST 失效模式与治理危害。

    2. 有哪些相关研究?

      涵盖长上下文指令保持、智能体安全基准与防御、无限时界安全分析及通用记忆与自我修正基线。

    3. 论文如何解决这个问题?

      基于条件风险理论证明,提出耦合在线语义约束恢复与执行前确定性审计修复的双层防御框架。

    4. 论文做了哪些实验?

      在 7 个模型上评测 SCARBench,GPT-5.5 的 GHOST 率达 11.5%,STAR-Guard 消除违规。

    5. 有什么可以进一步探索的点?

      作者指出防御保证依赖前端正确性、干预影响完成度等局限,并指明机理与规则表达等后续方向。

    6. 总结一下论文的主要内容

      揭示 GHOST 跨轮约束遗忘风险,构建 SCARBench 基准并通过 STAR-Guard 双层防御消除违规。

    完整解读
  11. 防御arXiv:2610.03089 · 53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。

    • 0%STEER-Bench 全部 199 个攻击单元格,完整 COBRA 系统的 ASR
    • 97%STEER-Bench 138 个良性单元格,COBRA 相比 Dual-LLM 保留的良性效用
    • 89.5%STEER-Bench 74 个通用智能体单元格,Vanilla Dual-LLM 基线的 ASR
    6 问速览动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
    1. 这篇论文试图解决什么问题?

      动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。

    2. 有哪些相关研究?

      梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。

    3. 论文如何解决这个问题?

      提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。

    4. 论文做了哪些实验?

      在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。

    5. 有什么可以进一步探索的点?

      作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。

    6. 总结一下论文的主要内容

      提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    完整解读
  12. 防御arXiv:2609.33039 · 54

    TACIT:从 LLM 内部状态检测 Agent 轨迹危害

    作者提出基于冻结内部表征读取的TACIT检测智能体轨迹;在6个基准上Qwen3-4B Multi-layer平均macro-F1达86.2%(Table 1)。

    • 86.2%Qwen3-4B下TACIT Multi-layer在6个基准上的平均macro-F1(Table 1)
    • 62.3%AgentDoG-4B在6个基准上的平均macro-F1(Table 1)
    • 65.7%Qwen3-4B下TACIT Multi-layer在留一基准评估中的平均macro-F1(Table 2)
    6 问速览解决开源 Guard 模型在智能体轨迹上难以有效检测不安全工具使用与多步交互风险的问题。
    1. 这篇论文试图解决什么问题?

      解决开源 Guard 模型在智能体轨迹上难以有效检测不安全工具使用与多步交互风险的问题。

    2. 有哪些相关研究?

      涉及智能体轨迹安全基准、安全 Guard 模型以及基于模型内部表征的安全检测与干预三类研究。

    3. 论文如何解决这个问题?

      提出 TACIT,从冻结骨干网络的中间层读取表征并通过线性探针、集成或多层聚合输出安全评分。

    4. 论文做了哪些实验?

      在 6 个基准上评测了检测性能、留一泛化能力、与 SFT 结合效果及训练与推理效率。

    5. 有什么可以进一步探索的点?

      作者指出流式检测需动作级评测与闭环校准,且需构建平衡两类风险的基准;实验覆盖 6 个离线基准与 2 类模型。

    6. 总结一下论文的主要内容

      提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。

    完整解读
  13. 防御arXiv:2609.38983 · 58

    论文提出 Approval Laundering 分类,实测 Claude Code 审批与执行绑定失败

    在Claude Code上测试表明审批与执行动作存在六类解绑失效,基于HMAC的Approval Token可消除委托与时序洗白但无法防范效果偏离。

    • 1.000Claude Code在Scope场景下的基线BGR(Table 3)
    • 1.000Claude Code在Temporal场景下的基线BGR(Table 3)
    • 0.947Claude Code在Delegation场景下的基线BGR(Table 3)
    6 问速览研究编程智能体套件中人类审批与底层工具执行动作脱钩的审批洗白问题,分析六类凭证绑定失效模式。
    1. 这篇论文试图解决什么问题?

      研究编程智能体套件中人类审批与底层工具执行动作脱钩的审批洗白问题,分析六类凭证绑定失效模式。

    2. 有哪些相关研究?

      对比智能体授权机制、测量基准与混淆代理研究,指出现有工作均未覆盖全部六类凭证绑定失效。

    3. 论文如何解决这个问题?

      形式化准入与效果偏离条件,构建六维分类学,提出七字段 HMAC 权能凭证 Approval Token 进行预执行验证。

    4. 论文做了哪些实验?

      在 Claude Code 上实测六类场景基线 BGR,并通过 118 次离线重放和实时烟雾测试验证防御效果与局限。

    5. 有什么可以进一步探索的点?

      指出跨套件泛化、效果偏离拦截、真实感知评测与密钥保管等局限,列明实验覆盖范围。

    6. 总结一下论文的主要内容

      系统揭示编程智能体审批洗白风险,提出七字段权能防御机制,证实其能消除身份时序偏离但难防副作用偏离。

    完整解读
  14. 防御arXiv:2610.01535 · 53

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    在分布偏移下,事后最佳单模型基线产生 0.045 至 0.113 的选择代价,诚实评分下安全路由在多数池单元退化为固定模型选择。

    • 0.045至0.113HELM Safety类别留出下,k=2至44的基线选择代价(Table II)
    • -0.0308HELM Safety类别留出下,k=44时路由器相对于诚实基准的危害差(Table II)
    • 0.0000HELM类别留出下,各池规模路由器相对于诚实基准的危害差中位数(Section IV)
    6 问速览测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。
    1. 这篇论文试图解决什么问题?

      测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。

    2. 有哪些相关研究?

      现有研究揭示了路由同样本评估偏倚与退化现象,本文系统量化安全分布偏移下的代价与防御脆弱性。

    3. 论文如何解决这个问题?

      建立诚实留出评估协议,推导超额危害分解恒等式,并评估门槛表面与动作防御。

    4. 论文做了哪些实验?

      分布偏移下后验基准产生大额偏差,诚实评估下路由收益微弱且识别信号易被操纵。

    5. 有什么可以进一步探索的点?

      作者指出了语料范围、评测器偏差与离线假设等局限,实际实验覆盖至 7 个公开语料。

    6. 总结一下论文的主要内容

      论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。

    完整解读
  15. 防御arXiv:2608.21500 · 56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    针对自适应提示注入,论文提出基于同策略蒸馏的防御微调方法 SecOPD,在 Qwen3.6-27B 上将 PISmith ASR 降至 9.0%(Table 1)。

    • 9.0%Qwen3.6-27B,SecOPD,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 94.0%Qwen3.6-27B,Meta-SecAlign,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 1.3%Qwen3.6-27B,SecOPD,SEP 数据集,六类静态攻击组合,Combined ASR(Table 1)
    6 问速览论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。
    1. 这篇论文试图解决什么问题?

      论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。

    2. 有哪些相关研究?

      论文梳理了系统级防御、模型级序列反馈防御、自适应攻击及同策略蒸馏研究,将 OPD 机制引入提示注入安全防御领域。

    3. 论文如何解决这个问题?

      SecOPD 利用良性输入下的基座模型作为安全教师,通过跨上下文 token 打分计算优势值,对受攻击输出实现细粒度监督更新。

    4. 论文做了哪些实验?

      实验覆盖 SEP 与 AgentDojo 两大安全基准及六项实用性测试,展示 SecOPD 在抵御自适应攻击的同时较好保全了模型原有能力。

    5. 有什么可以进一步探索的点?

      作者指出了仅适用间接注入、依赖可信边界输入及推理链缺乏注入感知等局限,并指明了后续研究方向。

    6. 总结一下论文的主要内容

      SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。

    完整解读
  16. 防御arXiv:2610.00400 · 56

    DART:用表征位移检测多轮 LLM 智能体中的新兴安全风险

    作者提出DART,通过去噪表征转移检测多轮攻击,在MT-AgentRisk上将6个模型平均ASR从84%降至25%。

    • 25%6个模型在MT-AgentRisk上DART防御后的平均ASR(§5.2)
    • 84%6个模型在MT-AgentRisk上无防御时的平均ASR(§5.2)
    • 52%6个模型在ASEval上DART防御后的平均ASR(§5.2)
    6 问速览多轮智能体攻击可将合规步骤组合为有害行为,现有单步防御难以识别且表征累加易受良性漂移干扰。
    1. 这篇论文试图解决什么问题?

      多轮智能体攻击可将合规步骤组合为有害行为,现有单步防御难以识别且表征累加易受良性漂移干扰。

    2. 有哪些相关研究?

      现有研究涵盖单步动作护栏、多轮推测或知识防御以及内部表征监控,DART定位为轻量复用自身隐藏状态的轨迹级防御。

    3. 论文如何解决这个问题?

      DART在固定层提取表征转移并投影到去噪安全方向,通过累加位移检测攻击、按最大增量归因上下文并注入针对性提醒。

    4. 论文做了哪些实验?

      论文在6个模型和多个多轮及注入基准上评测了检测率、ASR、良性效用与计算开销,验证了去噪机制与提示词干预的效果。

    5. 有什么可以进一步探索的点?

      作者指出当前防御面临干预失效、细粒度信息保留缺失以及多轮分解难以剔除等局限,未来需探索更强缓解手段与级联架构。

    6. 总结一下论文的主要内容

      DART利用去噪表征转移监测多轮攻击并注入提醒,在保持良性效用同时降低攻击成功率,每步仅增加零点几秒开销。

    完整解读
  17. 防御arXiv:2609.14003 · 56

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    作者针对智能体隐私泄漏提出FLOWSEAL防御,在SPR基准上将CWL攻击的条目泄漏率从52.2%降至0.5%。

    • 0.5%DeepSeek-V3.2下SPR基准CWL攻击FLOWSEAL的LRI
    • 52.2%DeepSeek-V3.2下SPR基准CWL攻击SPR-D2的LRI
    • 2.3%DeepSeek-V3.2下SPR基准SOA攻击FLOWSEAL的LRI
    6 问速览解决现有提示词防御在对手控制的上下文中做隐私判定导致机制与攻击面重合的问题。
    1. 这篇论文试图解决什么问题?

      解决现有提示词防御在对手控制的上下文中做隐私判定导致机制与攻击面重合的问题。

    2. 有哪些相关研究?

      梳理智能体隐私基准、基于模型的隐私防御及信息流控制,指出本文将强制执行移至上下文外。

    3. 论文如何解决这个问题?

      FLOWSEAL在工具边界设立代码拦截器,结合数据溯源、三级格策略与独立内容检查实现信息流控制。

    4. 论文做了哪些实验?

      在三项基准、多种模型与真实MCP测试中,FLOWSEAL将新型攻击泄漏率压至2.3%以下并保持72.4%实用率。

    5. 有什么可以进一步探索的点?

      作者指出检查器存在改写漏检与误拒局限,未登记数据存在盲区,未来可探索系统层多层防御。

    6. 总结一下论文的主要内容

      作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。

    完整解读
  18. 防御arXiv:2609.07529 · 53

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    CoER通过双边对抗共进化与精炼防御自适应IPI,在七领域将Qwen3.5-9B自适应ASR降至0.22%。

    • 0.22±0.13%Qwen3.5-9B在七领域自适应ASR(Table 1a)
    • 76.24±1.08%Qwen3.5-9B在七领域自适应Safe-U(Table 1a)
    • 41.31±0.89%Base在七领域自适应ASR(Table 1a)
    6 问速览论文试图解决工具调用智能体在多轮任务中抵御能够依据执行反馈持续调整策略的自适应间接提示注入问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决工具调用智能体在多轮任务中抵御能够依据执行反馈持续调整策略的自适应间接提示注入问题。

    2. 有哪些相关研究?

      论文梳理了IPI评测与防御、自适应攻击发现与精炼、攻防共进化三类研究,并强调自身在任务执行内闭环博弈的定位。

    3. 论文如何解决这个问题?

      CoER将攻防建模为一般和马尔可夫博弈,通过SFT冷启动攻击者、双边历史对抗RL共同进化,再由保留攻击者引导教师数据精炼。

    4. 论文做了哪些实验?

      CoER在七领域将自适应ASR降至0.22%、Safe-U升至76.24%,并在外部基准与累积攻击下保持高防守。

    5. 有什么可以进一步探索的点?

      作者指出方法依赖强教师与顺序流程且超参数敏感,评测范围未覆盖多模态、其他智能体框架及更大模型骨干。

    6. 总结一下论文的主要内容

      CoER针对自适应IPI结合双边对抗共进化与强教师精炼,在七领域将Qwen3.5-9B的自适应ASR降至0.22%。

    完整解读
  19. 防御arXiv:2609.18411 · 55

    可验证行动卡片 VAC:为智能体浏览器提供可信人在回路确认

    针对智能体浏览器中的提示注入与确认伪造,论文提出可验证操作卡VAC,在5个开源模型评测中将攻击成功率从78%降至0%(Table 10)。

    • 78%全部模型与种子无门控(Arm A)平均ASR(Table 10)
    • 0%全部模型与种子VAC(Arm C)平均ASR(Table 10)
    • 72%全部模型与种子Naive HITL(Arm B)平均ASR(Table 10)
    6 问速览论文解决智能体浏览器中因页面内容篡改确认界面导致的人在回路防御失效问题,提出基于真实操作重构的可验证操作卡。
    1. 这篇论文试图解决什么问题?

      论文解决智能体浏览器中因页面内容篡改确认界面导致的人在回路防御失效问题,提出基于真实操作重构的可验证操作卡。

    2. 有哪些相关研究?

      相关工作涉及网页智能体、间接注入攻击、推理层架构防御及同意完整性,论文通过构建浏览器端真实操作描述符弥补确认信道缺陷。

    3. 论文如何解决这个问题?

      VAC 架构通过意图来源隔离、DOM 真实操作描述符、浏览器外置卡片、风险门控与分发时执行绑定,确保批准与执行完全一致。

    4. 论文做了哪些实验?

      在 5 个开源模型及 GPT-4.1 上评测 24 个场景,无门控 ASR 为 68%–100%,VAC 在全部模型上降至 0% 且误报率为 0%。

    5. 有什么可以进一步探索的点?

      论文局限包括依赖启发式规则与预言机模拟、无法防护只读误导,未来方向包括真人受试者实验及向计算机使用智能体拓展。

    6. 总结一下论文的主要内容

      论文针对人在回路弹窗易受骗问题,提出提取 DOM 真实参数的外置验证卡 VAC,在跨模型评测中将攻击成功率完全归零。

    完整解读
  20. 防御arXiv:2609.35932 · 57

    同字节不同权限:保留 token 表示如何放大聊天模板提示注入

    研究者在固定字节下评测对话模板注入,发现去除保留词元使Llama-3.1等模型ASR降低39-66个百分点,权威性源于单个向量。

    • +58.2 ppLlama-3.1-8B在InjecAgent直接危害上的标识差距Δ(Table 2)
    • +65.5 ppGLM-4.5在InjecAgent数据窃取上的标识差距Δ(Table 2)
    • +49.8 ppQwen3-8B抑制思考块后直接危害标识差距Δ(Table 27)
    6 问速览研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。
    1. 这篇论文试图解决什么问题?

      研究探究对话模板提示注入的威力来源,聚焦保留控制词元的学得向量表示与模板文本语法的作用差异,并界定分词防御范畴。

    2. 有哪些相关研究?

      梳理了间接提示注入评测、对话模板伪造攻击、分词对抗扰动以及指令数据分离防御四类相关研究,指明本文固定字节解耦视角。

    3. 论文如何解决这个问题?

      通过固定字节下的保留与子词切分对比,引入词元数补偿对照定义标识差距,结合向量替换因果干预与来源感知分词器验证防御。

    4. 论文做了哪些实验?

      在两项基准上验证了保留词元向量的主导作用,揭示了思考推理的补偿效应、工具协议词元防御缺口及自适应嵌入搜索威胁。

    5. 有什么可以进一步探索的点?

      作者指出了开源自托管范围、工具调用解析判定标准与输入层干预三项局限,其实验覆盖了六个开源模型与两大评估基准。

    6. 总结一下论文的主要内容

      对话模板注入的权威性主要来自保留词元的学得向量而非文本语法,推理具有补偿作用,现有分词防御遗留工具协议漏洞。

    完整解读