跳到正文
10月8日 · 周四

提示注入 · 论文

精选论文 29 篇
  1. 防御arXiv:2609.11757 · 60

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    作者对AP2开展Whisper决策攻击与A-VIP防御,事实操纵在gemini-3.1-flash-lite达73.3%。

    • 90%gemini-2.5-flash-lite上Vault Whisper成功率(Table 3)
    • 56%gemini-2.5-flash-lite上Branded Whisper成功率(Table 3)
    • 73.3%gemini-3.1-flash-lite上Selection Whisper成功率(Table 3)
    6 问速览协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。
    1. 这篇论文试图解决什么问题?

      协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。

    2. 有哪些相关研究?

      现有研究涵盖智能体支付安全、提示注入基准及模型输入输出防御,但缺乏意图与决策的协议层绑定。

    3. 论文如何解决这个问题?

      A-VIP将意图视为权能授权,通过会话令牌解耦凭据、结构化比对绑定购物车,并对未授权超支触发确认。

    4. 论文做了哪些实验?

      评测覆盖17个Google模型及跨厂商模型,实测记录到事实操纵普遍有效,A-VIP成功拦截结构篡改。

    5. 有什么可以进一步探索的点?

      作者指出同价替换无法拦截、确认依赖用户审查及扫描器误报等局限,未来可探索多轮社工与密码学证明。

    6. 总结一下论文的主要内容

      论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。

    完整解读
  2. 防御arXiv:2610.05640 · 55

    研究揭示 CaMeL 防护在多智能体系统中失效并提出 multi-CaMeL

    论文提出 multi-CaMeL 防御,在 MultiAgentDojo 上将平均 ASR 从 12.9% 降至 0.0%。

    • 0.0%MultiAgentDojo 平均 ASR,multi-CaMeL(Table III)
    • 12.9%MultiAgentDojo 平均 ASR,No CaMeL(Table III)
    • 0.2%MultiAgentDojo 平均 ASR,单智能体 CaMeL(Table III)
    6 问速览单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。
    1. 这篇论文试图解决什么问题?

      单个智能体的控制流完整性无法在分层多智能体系统中直接组合,非可信数据跨边界会被下游智能体当作可信指令而劫持控制流。

    2. 有哪些相关研究?

      论文梳理了间接提示注入防御、多智能体协作与安全性、以及控制流完整性与信息流控制等方向的研究。

    3. 论文如何解决这个问题?

      提出 multi-CaMeL 协议,将智能体间调用拆分为可信指令与非可信变量两个通道,并由解释器在运行时保持溯源。

    4. 论文做了哪些实验?

      在 MultiAgentDojo 与 AssetOpsBench 上测试 5 款模型,multi-CaMeL 将 ASR 降至 0.0% 且效用代价较小。

    5. 有什么可以进一步探索的点?

      局限包括仅限树状拓扑、继承了 CaMeL 解释器的隐式依赖缺陷;未来可扩展至非树状架构并建立更强信息流保证。

    6. 总结一下论文的主要内容

      论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。

    完整解读
  3. 防御arXiv:2610.05163 · 59

    研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准

    作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。

    • 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    • 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
    • 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
    6 问速览长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
    1. 这篇论文试图解决什么问题?

      长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。

    2. 有哪些相关研究?

      梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。

    3. 论文如何解决这个问题?

      PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。

    4. 论文做了哪些实验?

      PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。

    5. 有什么可以进一步探索的点?

      作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。

    6. 总结一下论文的主要内容

      论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。

    完整解读
  4. 评测/基准arXiv:2610.03448 · 60

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    作者在两个智能体基准上评估15个提示注入检测器,发现基准排名迁移性弱且误报常使任务中断,训练输入形态决定检测效果。

    • 95.1%PIGuard 在 BIPIA 测试集上 1% FPR 下的 TPR(Table 2)
    • 2.1%PIGuard 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    • 82.2%Horizon-Labs 在 AD-Matched 上 1% FPR 下的 TPR(Table 2)
    6 问速览公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。
    1. 这篇论文试图解决什么问题?

      公开基准评测难以反映提示注入检测器在智能体真实工具输出下的检测率与误报代价,基准排名存在迁移偏差。

    2. 有哪些相关研究?

      研究涵盖注入检测评测方法、安全实证缺陷、检测防御及多层防护,作者强调现有评测忽视了工具输出形态与训练数据泄漏。

    3. 论文如何解决这个问题?

      通过无模型重放生成良性输出、环境差异重放标注注入、审计训练集重合,在低误报率运行点下度量检测表现。

    4. 论文做了哪些实验?

      评测15个检测器与2个评审模型,发现基准间检测排名不相关,训练集形态决定效果,移除格式可降低默认误报。

    5. 有什么可以进一步探索的点?

      作者指出当前局限在于模拟环境、静态模板、检测器覆盖度及评审设计;实验覆盖了15个分类器与2个智能体基准。

    6. 总结一下论文的主要内容

      论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。

    完整解读
  5. 防御arXiv:2610.03089 · 53

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    COBRA 通过事前分支能力约束与代理拦截,在 STEER-Bench 上将攻击成功率降至 0% 并保留 97% 良性效用。

    • 0%STEER-Bench 全部 199 个攻击单元格,完整 COBRA 系统的 ASR
    • 97%STEER-Bench 138 个良性单元格,COBRA 相比 Dual-LLM 保留的良性效用
    • 89.5%STEER-Bench 74 个通用智能体单元格,Vanilla Dual-LLM 基线的 ASR
    6 问速览动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。
    1. 这篇论文试图解决什么问题?

      动态网页促使计划产生分支,导致攻击者可通过操控数据诱导智能体执行危险分支(分支转向攻击)。

    2. 有哪些相关研究?

      梳理了 CUA 概率性防御、Dual-LLM 等系统级架构、MCP 安全及现有评测基准,指出 DFI 防御的缺失。

    3. 论文如何解决这个问题?

      提出 COBRA 架构,结合离线计划能力约束、运行时分支解析中枢及确定性 HTTP/MCP 代理拦截。

    4. 论文做了哪些实验?

      在 STEER-Bench 及 4 个外部基准中将 ASR 降至 0%,在 OSWorld-MCP 上保留实用任务完成能力。

    5. 有什么可以进一步探索的点?

      作者指出其在未体现在网络请求的视觉数值、自由文本语义、非 HTTP 接口及对站点描述的依赖等局限。

    6. 总结一下论文的主要内容

      提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    完整解读
  6. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  7. 评测/基准arXiv:2609.09404 · 56

    MMPIBench:多模态提示注入对六种 Agent 框架的跨框架评测

    作者用MMPIBench测试多模态提示注入对6个智能体框架的影响,发现视觉通道尝试率12.8%高于完成率1.11%,音频完成率达49%。

    • 1.11%MMPIBench视觉通道总体完成率(720次运行,Table I)
    • 12.8%MMPIBench视觉通道总体尝试率(720次运行,Table I)
    • 0.0%Claude Opus 4.8在MMPIBench视觉通道的尝试率(Table III)
    6 问速览论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决多模态间接提示注入在智能体架构内部如何传播、被何处阻断,以及框架与模型在防御中各自所起作用的问题。

    2. 有哪些相关研究?

      相关研究包括文本与工具智能体注入基准、多模态与GUI攻击以及防御机制,论文在跨框架与白盒阶段追踪上与之形成对比。

    3. 论文如何解决这个问题?

      论文构建MMPIBench统一评测框架,通过固定变量适配层、白盒阶段插桩、双层评审协议与音频扩展解耦系统脆弱性。

    4. 论文做了哪些实验?

      论文在图像通道完成720次全矩阵测试,在音频通道完成72次测试,发现尝试率远超完成率,模型是主导因素,音频缺乏防御。

    5. 有什么可以进一步探索的点?

      作者指出了单次测试随机性、框架配置与重测混淆、跨模态设定不一致等局限;实验覆盖了特定的模型、框架与模拟工具。

    6. 总结一下论文的主要内容

      论文提出MMPIBench评测多模态提示注入对智能体的影响,发现模型主导行为、尝试远超完成,音频通道缺乏防护。

    完整解读
  8. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  9. 防御arXiv:2610.01535 · 53

    论文:安全路由评测在分布偏移下失效,基线选取偏差被低估

    在分布偏移下,事后最佳单模型基线产生 0.045 至 0.113 的选择代价,诚实评分下安全路由在多数池单元退化为固定模型选择。

    • 0.045至0.113HELM Safety类别留出下,k=2至44的基线选择代价(Table II)
    • -0.0308HELM Safety类别留出下,k=44时路由器相对于诚实基准的危害差(Table II)
    • 0.0000HELM类别留出下,各池规模路由器相对于诚实基准的危害差中位数(Section IV)
    6 问速览测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。
    1. 这篇论文试图解决什么问题?

      测试集后验基准在分布偏移下夸大固定模型表现,使安全路由评估产生虚假下限。

    2. 有哪些相关研究?

      现有研究揭示了路由同样本评估偏倚与退化现象,本文系统量化安全分布偏移下的代价与防御脆弱性。

    3. 论文如何解决这个问题?

      建立诚实留出评估协议,推导超额危害分解恒等式,并评估门槛表面与动作防御。

    4. 论文做了哪些实验?

      分布偏移下后验基准产生大额偏差,诚实评估下路由收益微弱且识别信号易被操纵。

    5. 有什么可以进一步探索的点?

      作者指出了语料范围、评测器偏差与离线假设等局限,实际实验覆盖至 7 个公开语料。

    6. 总结一下论文的主要内容

      论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。

    完整解读
  10. 防御arXiv:2608.21500 · 56

    SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%

    针对自适应提示注入,论文提出基于同策略蒸馏的防御微调方法 SecOPD,在 Qwen3.6-27B 上将 PISmith ASR 降至 9.0%(Table 1)。

    • 9.0%Qwen3.6-27B,SecOPD,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 94.0%Qwen3.6-27B,Meta-SecAlign,SEP 数据集,PISmith 自适应攻击,pass@10 ASR(Table 1)
    • 1.3%Qwen3.6-27B,SecOPD,SEP 数据集,六类静态攻击组合,Combined ASR(Table 1)
    6 问速览论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。
    1. 这篇论文试图解决什么问题?

      论文针对现有序列级防御难以抵御自适应提示注入的问题,提出通过 token 级同策略蒸馏实现精细信用分配的 SecOPD 防御。

    2. 有哪些相关研究?

      论文梳理了系统级防御、模型级序列反馈防御、自适应攻击及同策略蒸馏研究,将 OPD 机制引入提示注入安全防御领域。

    3. 论文如何解决这个问题?

      SecOPD 利用良性输入下的基座模型作为安全教师,通过跨上下文 token 打分计算优势值,对受攻击输出实现细粒度监督更新。

    4. 论文做了哪些实验?

      实验覆盖 SEP 与 AgentDojo 两大安全基准及六项实用性测试,展示 SecOPD 在抵御自适应攻击的同时较好保全了模型原有能力。

    5. 有什么可以进一步探索的点?

      作者指出了仅适用间接注入、依赖可信边界输入及推理链缺乏注入感知等局限,并指明了后续研究方向。

    6. 总结一下论文的主要内容

      SecOPD 通过纯净上下文 token 级同策略蒸馏,在 Qwen3.6-27B 上将自适应攻击 ASR 降至 9.0% 并保持了模型通用能力。

    完整解读
  11. 评测/基准arXiv:2609.02316 · 55

    Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息,C-GEO Guard 将攻击成功率相对降低 47.6%

    作者构建基准评测GEO虚假信息防御,现有护栏最多降低ASR 3.2个百分点,所提检测器在三模型上平均降低26.5个百分点。

    • 55.7%未防御流水线在三模型上的平均 ASR(Table 3)
    • 29.2%C-GEO Guard 在三模型上的平均 ASR(Table 3)
    • 1.7 ppGranite Guardian 在三模型上的平均 ASR 降幅(Table 3)
    6 问速览论文旨在解决生成式搜索引擎中利用 GEO 嵌入虚假事实的隐蔽误导攻击,并填补针对该威胁的防御评测基准空白。
    1. 这篇论文试图解决什么问题?

      论文旨在解决生成式搜索引擎中利用 GEO 嵌入虚假事实的隐蔽误导攻击,并填补针对该威胁的防御评测基准空白。

    2. 有哪些相关研究?

      论文梳理了生成式引擎优化、RAG 数据投毒、安全护栏及安全基准四类研究,指出此前缺乏针对 GEO 事实扭曲的防御基准。

    3. 论文如何解决这个问题?

      论文构建了质量门控的双配对基准 COUNTER-GEO-BENCH,并提出了基于攻击类原型的分块对比检测基线 C-GEO Guard。

    4. 论文做了哪些实验?

      论文在三款受害模型上评估了四种防御,通用护栏 ASR 最多降 3.2 个百分点,C-GEO Guard 平均降 26.5 个百分点且跨重写器泛化。

    5. 有什么可以进一步探索的点?

      作者指出了规模、多语言、商业产品与自适应攻击等局限;实验覆盖了三款开源模型、247 项英语查询及单文档威胁。

    6. 总结一下论文的主要内容

      论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。

    完整解读
  12. 攻击arXiv:2607.05189 · 58

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    MEMGHOST利用环境与目标双代理离线训练,在OpenClaw+GPT-5.4后台模式取得87.5%端到端记忆注入成功率。

    • 87.5%OpenClaw+GPT-5.4 后台模式 E2E 成功率(Table I)
    • 75.0%OpenClaw+GPT-5.4 前台模式 E2E 成功率(Table I)
    • 71.4%Claude Code SDK+Sonnet 4.6 后台模式 E2E(Table I)
    6 问速览论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。
    1. 这篇论文试图解决什么问题?

      论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。

    2. 有哪些相关研究?

      梳理了智能体安全评估、间接提示词注入与记忆投毒研究,指出现存工作缺乏对外部无交互全周期记忆注入的建模。

    3. 论文如何解决这个问题?

      通过轻量影子环境与细则奖励双代理,利用 SFT 与 GRPO 训练生成策略,实现单次前向生成免交互隐蔽邮件。

    4. 论文做了哪些实验?

      在 6 种模型及多框架上验证,MEMGHOST 在前沿与低成本模型上显著优于 7 种基线并实现跨架构迁移。

    5. 有什么可以进一步探索的点?

      作者指出未覆盖投递层基础设施、多模态载荷与长期衰减;实验覆盖了 6 类模型与 4 种智能体框架。

    6. 总结一下论文的主要内容

      总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    完整解读
  13. 攻击arXiv:2609.01222 · 57

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    作者分析了 12 个真实智能体 Harness 的上下文组装设计,提出 16 种攻击向量实现消息角色和跨作用域的特权提升。

    • 28212 个智能体 Harness 中经 CORA 运行时验证的上下文源总数(Table VI)
    • 176112 个智能体 Harness 中由 CORA 枚举的唯一候选 CPE 路径总数(§ VI-C)
    • 1034 (58%)GPT-5.5 在 12 个智能体共 1761 条候选路径上的行为验证结果(Table VII)
    6 问速览智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。
    1. 这篇论文试图解决什么问题?

      智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。

    2. 有哪些相关研究?

      相关研究聚焦于间接提示注入、指令层级防御和智能体扩展规范,本文聚焦智能体 Harness 上下文组装的结构性缺陷。

    3. 论文如何解决这个问题?

      形式化定义 M-CPE 与 X-CPE 两类攻击及 16 种攻击向量,开发静态分析与两轮插桩验证工具 CORA。

    4. 论文做了哪些实验?

      在 12 个智能体上验证了 282 个上下文源与 1761 条路径,在 GPT-5.5 下行为验证率达 58% 并完成端到端 PoC。

    5. 有什么可以进一步探索的点?

      作者指出了 CORA 环境构建失败、模型安全对齐导致未遵循指令等局限,并倡议厂商发布上下文清单(SBOM)。

    6. 总结一下论文的主要内容

      论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    完整解读
  14. 攻击arXiv:2607.26115 · 60

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    作者通过自博弈强化学习训练红队智能体GPT-Red,使GPT-5.6在Fake CoT提示词注入下的鲁棒性达到95.9%。

    • 95.9%GPT-5.6在Fake CoT攻击下的IH鲁棒性(GPT-5.1为5.2%,Figure 13)
    • 94.3%GPT-5.6在Multi-Defender攻击下的IH鲁棒性(GPT-5.1为0.4%,Figure 13)
    • 99.5%GPT-5.6在System Override攻击下的IH鲁棒性(Figure 13)
    6 问速览解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。
    1. 这篇论文试图解决什么问题?

      解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。

    2. 有哪些相关研究?

      涵盖基于优化的对抗攻击、指令层级防御、提示驱动的大模型红队以及多智能体对抗博弈等相关研究。

    3. 论文如何解决这个问题?

      构建带防守者查询接口的智能体脚手架,基于大规模安全环境和多防守者种群进行自博弈强化学习训练。

    4. 论文做了哪些实验?

      在真实智能体、挑战赛基准和留存域上全面评估,GPT-Red突破旧模型并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    5. 有什么可以进一步探索的点?

      作者指出多模态与多轮场景训练相对不足,且评测主要集中于特定智能体工具任务并省略了系统级缓解。

    6. 总结一下论文的主要内容

      通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    完整解读
  15. 攻击arXiv:2608.23858 · 56

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

    • 66.7%STRIDE-GPT五架构运行对48个威胁的Full/Partial覆盖率(8.1节)
    • 0.9848位独立专家对25个威胁AIVSS严重度评级的Gwet's AC2估计值(Table 6)
    • 92.5%8位专家在120次评估中重现单评估者AIVSS参考严重度等级的比例(8.2节)
    6 问速览分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。
    1. 这篇论文试图解决什么问题?

      分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    2. 有哪些相关研究?

      梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    3. 论文如何解决这个问题?

      划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    4. 论文做了哪些实验?

      通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    5. 有什么可以进一步探索的点?

      作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    6. 总结一下论文的主要内容

      系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    完整解读
  16. 攻击arXiv:2609.04533 · 59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    作者针对黑盒VLM提出自适应视觉提示注入,在DocVQA下对GPT-5.5实现47%工具调用ASR(Table 2)。

    • 47%GPT-5.5在DocVQA的Call-Tool ASR(Table 2)
    • 90%Opus-4.7在DocVQA的Steal-PII ASR(Table 2)
    • 96%Qwen3.6-27B在DocVQA的Call-Tool ASR(Table 2)
    6 问速览现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。
    1. 这篇论文试图解决什么问题?

      现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。

    2. 有哪些相关研究?

      相关研究涵盖视觉越狱、白盒对抗图像与多模态提示注入基准,但多放宽了良性指令竞争或黑盒限制。

    3. 论文如何解决这个问题?

      作者将攻击重塑为响应前缀控制,结合自动化黑盒自适应精炼与成功注入攻击库,诱导目标模型产生精确输出。

    4. 论文做了哪些实验?

      实验覆盖六款VLM与三个场景,该方法的工具调用与隐私窃取ASR均超过基线,并在OpenClaw智能体中实现越权。

    5. 有什么可以进一步探索的点?

      作者指出了高查询量导致API开销大、未测试tool return图像输入以及未针对防御展开自适应攻击等局限。

    6. 总结一下论文的主要内容

      论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    完整解读
  17. 攻击arXiv:2609.19587 · 59

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Opus 5红队测试中,Auto Mode与Guardian的平均ASR超55%(Figure 1)。

    • 65%Opus 5攻击Auto Mode四类攻击平均ASR(Figure 1)
    • 72%Opus 5攻击Guardian四类攻击平均ASR(Figure 1)
    • 9%Opus 5对Auto Mode ++四类攻击平均ASR(Figure 1)
    6 问速览阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。
    1. 这篇论文试图解决什么问题?

      阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。

    2. 有哪些相关研究?

      涵盖AI Control协议、监视器提示注入、多上下文分解攻击与自动化红队,对比Auto Mode与Guardian。

    3. 论文如何解决这个问题?

      通过红蓝对抗迭代,提出四类攻击方法,并设计集成转录加固、目录监控、压缩检查与智能体阶段的Auto Mode ++。

    4. 论文做了哪些实验?

      在Arena与模拟评测中,生产监视器ASR超55%;Auto Mode ++将平均ASR降至9%,但存在延迟代价。

    5. 有什么可以进一步探索的点?

      作者指出可信监视器假设、未测沙箱及多上下文防御的高延迟代价,模拟机制存在简化。

    6. 总结一下论文的主要内容

      系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    完整解读
  18. 攻击arXiv:2609.09553 · 55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    作者通过字母置换提示对前沿模型发起攻击,在 Claude Sonnet 4 上无需微调达成 100% ASR(Table II)。

    • 100%Claude Sonnet 4,Single-shot,ASR(Table II)
    • 80%Claude Sonnet 4.5,Iterative,ASR(Table II)
    • 100%Gemini 3 Flash,Iterative,ASR(Table II)
    6 问速览论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。
    1. 这篇论文试图解决什么问题?

      论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。

    2. 有哪些相关研究?

      论文梳理了优化类越狱、隐蔽与文本越狱、密码越狱等研究,指出既有密码越狱受限于微调接口或旧模型假设。

    3. 论文如何解决这个问题?

      作者设计了单轮置换与基于示例的递增迭代算法,通过上下文学习引导模型掌握密码,并关闭 reasoning 以绕过对齐。

    4. 论文做了哪些实验?

      测试显示前沿模型在特定密码变体下 ASR 可达 100%,而前代模型 ASR 均为 0%(Table I、II)。

    5. 有什么可以进一步探索的点?

      作者指出了密文拼写错误、回复细节较少、依赖禁用 reasoning 等局限,并提出交互式越狱及防御探索等后续方向。

    6. 总结一下论文的主要内容

      前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  19. 防御arXiv:2609.07529 · 53

    CoER:用对抗协同演化与精炼防御自适应间接提示注入

    CoER通过双边对抗共进化与精炼防御自适应IPI,在七领域将Qwen3.5-9B自适应ASR降至0.22%。

    • 0.22±0.13%Qwen3.5-9B在七领域自适应ASR(Table 1a)
    • 76.24±1.08%Qwen3.5-9B在七领域自适应Safe-U(Table 1a)
    • 41.31±0.89%Base在七领域自适应ASR(Table 1a)
    6 问速览论文试图解决工具调用智能体在多轮任务中抵御能够依据执行反馈持续调整策略的自适应间接提示注入问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决工具调用智能体在多轮任务中抵御能够依据执行反馈持续调整策略的自适应间接提示注入问题。

    2. 有哪些相关研究?

      论文梳理了IPI评测与防御、自适应攻击发现与精炼、攻防共进化三类研究,并强调自身在任务执行内闭环博弈的定位。

    3. 论文如何解决这个问题?

      CoER将攻防建模为一般和马尔可夫博弈,通过SFT冷启动攻击者、双边历史对抗RL共同进化,再由保留攻击者引导教师数据精炼。

    4. 论文做了哪些实验?

      CoER在七领域将自适应ASR降至0.22%、Safe-U升至76.24%,并在外部基准与累积攻击下保持高防守。

    5. 有什么可以进一步探索的点?

      作者指出方法依赖强教师与顺序流程且超参数敏感,评测范围未覆盖多模态、其他智能体框架及更大模型骨干。

    6. 总结一下论文的主要内容

      CoER针对自适应IPI结合双边对抗共进化与强教师精炼,在七领域将Qwen3.5-9B的自适应ASR降至0.22%。

    完整解读
  20. 评测/基准arXiv:2608.28411 · 55

    LongPIBench:面向长上下文提示注入的评测基准

    作者评测长文本提示注入,MetaSecAlign 8B在OPI基准的ASR为0.00,在LongPIBench聚合升至0.78。

    • 1.00Llama-3.1-8B-Instruct,合成论文评审,Authority spoof,ASR(Table 1)
    • 0.78MetaSecAlign 8B,长文本基准聚合,Combined attack,ASR(Table 5)
    • 0.00MetaSecAlign 8B,短文本OPI基准,Combined attack,ASR(Table 5)
    6 问速览现有基准主要评估短文本导致防御效果被高估,作者构建长文本提示注入基准LongPIBench以评估真实场景风险。
    1. 这篇论文试图解决什么问题?

      现有基准主要评估短文本导致防御效果被高估,作者构建长文本提示注入基准LongPIBench以评估真实场景风险。

    2. 有哪些相关研究?

      论文综述了提示注入的启发式与优化攻击、检测与预防防御及评测基准,指出既有基准缺乏长文本与优化攻击评估。

    3. 论文如何解决这个问题?

      作者构建覆盖4种场景的合成与真实长文档数据集,设计权威冒充攻击,并系统评测8种攻击与15种检测及预防防御。

    4. 论文做了哪些实验?

      实验覆盖8个LLM与15种防御,发现长文本下攻击ASR普遍走高,现有防御性能大幅衰退,检测器呈现分类失衡。

    5. 有什么可以进一步探索的点?

      作者指出未来需拓展至动态智能体流、阐明上下文稀释机制并扩展自适应与强化学习优化攻击。

    6. 总结一下论文的主要内容

      论文构建长文本提示注入基准LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。

    完整解读