跳到正文
10月8日 · 周四

提示注入 · 论文

精选论文 29 篇
  1. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  2. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  3. 攻击arXiv:2607.05189 · 58

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    MEMGHOST利用环境与目标双代理离线训练,在OpenClaw+GPT-5.4后台模式取得87.5%端到端记忆注入成功率。

    • 87.5%OpenClaw+GPT-5.4 后台模式 E2E 成功率(Table I)
    • 75.0%OpenClaw+GPT-5.4 前台模式 E2E 成功率(Table I)
    • 71.4%Claude Code SDK+Sonnet 4.6 后台模式 E2E(Table I)
    6 问速览论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。
    1. 这篇论文试图解决什么问题?

      论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。

    2. 有哪些相关研究?

      梳理了智能体安全评估、间接提示词注入与记忆投毒研究,指出现存工作缺乏对外部无交互全周期记忆注入的建模。

    3. 论文如何解决这个问题?

      通过轻量影子环境与细则奖励双代理,利用 SFT 与 GRPO 训练生成策略,实现单次前向生成免交互隐蔽邮件。

    4. 论文做了哪些实验?

      在 6 种模型及多框架上验证,MEMGHOST 在前沿与低成本模型上显著优于 7 种基线并实现跨架构迁移。

    5. 有什么可以进一步探索的点?

      作者指出未覆盖投递层基础设施、多模态载荷与长期衰减;实验覆盖了 6 类模型与 4 种智能体框架。

    6. 总结一下论文的主要内容

      总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    完整解读
  4. 攻击arXiv:2609.01222 · 57

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    作者分析了 12 个真实智能体 Harness 的上下文组装设计,提出 16 种攻击向量实现消息角色和跨作用域的特权提升。

    • 28212 个智能体 Harness 中经 CORA 运行时验证的上下文源总数(Table VI)
    • 176112 个智能体 Harness 中由 CORA 枚举的唯一候选 CPE 路径总数(§ VI-C)
    • 1034 (58%)GPT-5.5 在 12 个智能体共 1761 条候选路径上的行为验证结果(Table VII)
    6 问速览智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。
    1. 这篇论文试图解决什么问题?

      智能体 Harness 上下文组装设计不透明且缺乏规范,易遭特权提升攻击导致智能体受控或宿主机被远程代码执行。

    2. 有哪些相关研究?

      相关研究聚焦于间接提示注入、指令层级防御和智能体扩展规范,本文聚焦智能体 Harness 上下文组装的结构性缺陷。

    3. 论文如何解决这个问题?

      形式化定义 M-CPE 与 X-CPE 两类攻击及 16 种攻击向量,开发静态分析与两轮插桩验证工具 CORA。

    4. 论文做了哪些实验?

      在 12 个智能体上验证了 282 个上下文源与 1761 条路径,在 GPT-5.5 下行为验证率达 58% 并完成端到端 PoC。

    5. 有什么可以进一步探索的点?

      作者指出了 CORA 环境构建失败、模型安全对齐导致未遵循指令等局限,并倡议厂商发布上下文清单(SBOM)。

    6. 总结一下论文的主要内容

      论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    完整解读
  5. 攻击arXiv:2607.26115 · 60

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    作者通过自博弈强化学习训练红队智能体GPT-Red,使GPT-5.6在Fake CoT提示词注入下的鲁棒性达到95.9%。

    • 95.9%GPT-5.6在Fake CoT攻击下的IH鲁棒性(GPT-5.1为5.2%,Figure 13)
    • 94.3%GPT-5.6在Multi-Defender攻击下的IH鲁棒性(GPT-5.1为0.4%,Figure 13)
    • 99.5%GPT-5.6在System Override攻击下的IH鲁棒性(Figure 13)
    6 问速览解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。
    1. 这篇论文试图解决什么问题?

      解决现有对抗训练数据规模和多样性不足导致模型过拟合、难以抵御自适应提示词注入与越狱攻击的问题。

    2. 有哪些相关研究?

      涵盖基于优化的对抗攻击、指令层级防御、提示驱动的大模型红队以及多智能体对抗博弈等相关研究。

    3. 论文如何解决这个问题?

      构建带防守者查询接口的智能体脚手架,基于大规模安全环境和多防守者种群进行自博弈强化学习训练。

    4. 论文做了哪些实验?

      在真实智能体、挑战赛基准和留存域上全面评估,GPT-Red突破旧模型并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    5. 有什么可以进一步探索的点?

      作者指出多模态与多轮场景训练相对不足,且评测主要集中于特定智能体工具任务并省略了系统级缓解。

    6. 总结一下论文的主要内容

      通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。

    完整解读
  6. 攻击arXiv:2608.23858 · 56

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

    • 66.7%STRIDE-GPT五架构运行对48个威胁的Full/Partial覆盖率(8.1节)
    • 0.9848位独立专家对25个威胁AIVSS严重度评级的Gwet's AC2估计值(Table 6)
    • 92.5%8位专家在120次评估中重现单评估者AIVSS参考严重度等级的比例(8.2节)
    6 问速览分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。
    1. 这篇论文试图解决什么问题?

      分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    2. 有哪些相关研究?

      梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    3. 论文如何解决这个问题?

      划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    4. 论文做了哪些实验?

      通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    5. 有什么可以进一步探索的点?

      作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    6. 总结一下论文的主要内容

      系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    完整解读
  7. 攻击arXiv:2609.04533 · 59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    作者针对黑盒VLM提出自适应视觉提示注入,在DocVQA下对GPT-5.5实现47%工具调用ASR(Table 2)。

    • 47%GPT-5.5在DocVQA的Call-Tool ASR(Table 2)
    • 90%Opus-4.7在DocVQA的Steal-PII ASR(Table 2)
    • 96%Qwen3.6-27B在DocVQA的Call-Tool ASR(Table 2)
    6 问速览现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。
    1. 这篇论文试图解决什么问题?

      现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。

    2. 有哪些相关研究?

      相关研究涵盖视觉越狱、白盒对抗图像与多模态提示注入基准,但多放宽了良性指令竞争或黑盒限制。

    3. 论文如何解决这个问题?

      作者将攻击重塑为响应前缀控制,结合自动化黑盒自适应精炼与成功注入攻击库,诱导目标模型产生精确输出。

    4. 论文做了哪些实验?

      实验覆盖六款VLM与三个场景,该方法的工具调用与隐私窃取ASR均超过基线,并在OpenClaw智能体中实现越权。

    5. 有什么可以进一步探索的点?

      作者指出了高查询量导致API开销大、未测试tool return图像输入以及未针对防御展开自适应攻击等局限。

    6. 总结一下论文的主要内容

      论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    完整解读
  8. 攻击arXiv:2609.19587 · 59

    红队测试 Auto Mode:用注入与多上下文攻击绕过编码 Agent 阻断监控器

    Opus 5红队测试中,Auto Mode与Guardian的平均ASR超55%(Figure 1)。

    • 65%Opus 5攻击Auto Mode四类攻击平均ASR(Figure 1)
    • 72%Opus 5攻击Guardian四类攻击平均ASR(Figure 1)
    • 9%Opus 5对Auto Mode ++四类攻击平均ASR(Figure 1)
    6 问速览阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。
    1. 这篇论文试图解决什么问题?

      阻断监视器在面对具有持续对抗意图的长程代码智能体时缺乏有效防护与系统性防御设计。

    2. 有哪些相关研究?

      涵盖AI Control协议、监视器提示注入、多上下文分解攻击与自动化红队,对比Auto Mode与Guardian。

    3. 论文如何解决这个问题?

      通过红蓝对抗迭代,提出四类攻击方法,并设计集成转录加固、目录监控、压缩检查与智能体阶段的Auto Mode ++。

    4. 论文做了哪些实验?

      在Arena与模拟评测中,生产监视器ASR超55%;Auto Mode ++将平均ASR降至9%,但存在延迟代价。

    5. 有什么可以进一步探索的点?

      作者指出可信监视器假设、未测沙箱及多上下文防御的高延迟代价,模拟机制存在简化。

    6. 总结一下论文的主要内容

      系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。

    完整解读
  9. 攻击arXiv:2609.09553 · 55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    作者通过字母置换提示对前沿模型发起攻击,在 Claude Sonnet 4 上无需微调达成 100% ASR(Table II)。

    • 100%Claude Sonnet 4,Single-shot,ASR(Table II)
    • 80%Claude Sonnet 4.5,Iterative,ASR(Table II)
    • 100%Gemini 3 Flash,Iterative,ASR(Table II)
    6 问速览论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。
    1. 这篇论文试图解决什么问题?

      论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。

    2. 有哪些相关研究?

      论文梳理了优化类越狱、隐蔽与文本越狱、密码越狱等研究,指出既有密码越狱受限于微调接口或旧模型假设。

    3. 论文如何解决这个问题?

      作者设计了单轮置换与基于示例的递增迭代算法,通过上下文学习引导模型掌握密码,并关闭 reasoning 以绕过对齐。

    4. 论文做了哪些实验?

      测试显示前沿模型在特定密码变体下 ASR 可达 100%,而前代模型 ASR 均为 0%(Table I、II)。

    5. 有什么可以进一步探索的点?

      作者指出了密文拼写错误、回复细节较少、依赖禁用 reasoning 等局限,并提出交互式越狱及防御探索等后续方向。

    6. 总结一下论文的主要内容

      前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  10. 攻击arXiv:2608.30441 · 60

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    ECLIPSE结合直接与工具端注入,在LASE-Bench对DeepSeek无防御ASR为96.7%、带防御为69.2%。

    • 96.7%DeepSeek,LASE-Bench,无防御,ECLIPSE,ASR
    • 69.2%DeepSeek,LASE-Bench,带安全过滤,ECLIPSE,ASR
    • 62.4%Claude 4.8 Opus,LASE-Bench,带安全过滤,ECLIPSE,ASR
    6 问速览针对长任务智能体提示词注入在集中显式注入的高可检性与分布式注入的低保真度之间的权衡,提出兼顾隐蔽与控制的攻击框架。
    1. 这篇论文试图解决什么问题?

      针对长任务智能体提示词注入在集中显式注入的高可检性与分布式注入的低保真度之间的权衡,提出兼顾隐蔽与控制的攻击框架。

    2. 有哪些相关研究?

      涵盖直接提示词注入、环境/工具侧间接注入及长任务注入研究,本文通过双通道注入与双阶段轨迹引导弥补长时程控制与隐蔽的割裂。

    3. 论文如何解决这个问题?

      通过 SATS 在沙盒中合成隐蔽单轮请求,并结合静态工具工作流编码 SWE 与运行时残差补偿 DTC 实现闭环轨迹引导。

    4. 论文做了哪些实验?

      在 LASE-Bench 与 SHADE-Arena 上评测 7 款模型与 2 个原生系统,ECLIPSE 带防御 ASR 达 36.9%–69.2%,显著超越基线。

    5. 有什么可以进一步探索的点?

      论文未设独立局限章节,作者强调需发展多源联合推理防御;实验覆盖 7 款模型、2 个基准及 4 种防御机制。

    6. 总结一下论文的主要内容

      论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。

    完整解读
  11. 攻击arXiv:2609.13889 · 56

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    作者针对OpenClaw和Claude Code评估持久记忆投毒攻击PMPA,诱导其跨会话执行恶意动作并造成隐私泄露。

    • 73.7%OpenClaw所有设置平均ISR(摘要)
    • 55.5%OpenClaw所有设置平均C-ASR(摘要)
    • 66.9%Claude Code所有设置平均ISR(摘要)
    6 问速览论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。

    2. 有哪些相关研究?

      相关研究涵盖智能体与 harness 工程、提示注入攻击以及后门与记忆投毒攻击三类。

    3. 论文如何解决这个问题?

      论文提出了持久记忆投毒攻击 PMPA,通过两阶段工作流与三组件载荷设计,诱导智能体将外部恶意规则存入持久记忆并跨会话触发。

    4. 论文做了哪些实验?

      论文在两个智能体和三个模型上测得平均 ISR 达 66.9%–73.7%,跨会话 C-ASR 达 55.5%–81.7%,且防御对已写入记忆防护有限。

    5. 有什么可以进一步探索的点?

      作者计划未来在更广泛设置与更多模型上评估该攻击,并探索针对持久记忆投毒更有效的防御手段。

    6. 总结一下论文的主要内容

      论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    完整解读
  12. 攻击arXiv:2609.22510 · 59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    作者评估了条件触发的爆炸提示词,发现其在 Grok-4.20 上对真实工具执行的攻击成功率达 34.2%,而祈使形式为 0.0%。

    • 34.2%Grok-4.20 在 AgentDojo 上的 EP 工具执行成功率(Table 1)
    • 0.0%Grok-4.20 在 AgentDojo 上的 IPI 工具执行成功率(Table 1)
    • 16.5%7 款基础模型在 AgentDojo 上的 EP 配对均值(Table 1)
    6 问速览爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。
    1. 这篇论文试图解决什么问题?

      爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。

    2. 有哪些相关研究?

      论文对比了间接提示注入、智能体攻击、现存检测防御和后门机制,强调时间分离与无持久化特性。

    3. 论文如何解决这个问题?

      论文形式化了爆炸提示词生成空间,揭示条件化绕过机理,并提出了轻量滑动窗口检测器 DeFuse。

    4. 论文做了哪些实验?

      实验覆盖 7 款基础模型、4 类防御与 9 个生产智能体,证实爆炸提示词显著提高绕过率且可在摄入期检出。

    5. 有什么可以进一步探索的点?

      作者指出自适应改写、长会话存活等局限,实际评测覆盖 7 款基础模型与 9 款生产工具。

    6. 总结一下论文的主要内容

      论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    完整解读
  13. 攻击arXiv:2609.33628 · 60

    用课程强化学习对前沿模型做提示注入红队测试

    研究通过跨目标模型的课程强化学习解决冷启动,在AgentDyn上对GPT-5.6-Terra取得45.0% ASR@10。

    • 45.0%GPT-5.6-Terra在AgentDyn上的ASR@10(三阶段课程训练)
    • 93.8%GPT-5.6-Luna在AgentDyn上的ASR@10(三阶段课程训练)
    • 0.0%GPT-5.6-Terra在AgentDyn上的ASR@10(PISmith直接训练)
    6 问速览解决强化学习红队在攻击前沿大模型时面临的全零奖励冷启动挑战。
    1. 这篇论文试图解决什么问题?

      解决强化学习红队在攻击前沿大模型时面临的全零奖励冷启动挑战。

    2. 有哪些相关研究?

      梳理了静态、搜索与强化学习红队工作,提出跨目标模型的课程机制。

    3. 论文如何解决这个问题?

      通过冻结策略预测试和跨目标模型渐进训练,确保每阶段具备非零奖励信号。

    4. 论文做了哪些实验?

      对GPT-5.6-Terra实现45.0% ASR@10,且展示了跨模型与跨基准迁移能力。

    5. 有什么可以进一步探索的点?

      作者指出预算限制未训练Sol模型且建课成本高;实验受限于单一攻击基座。

    6. 总结一下论文的主要内容

      提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    完整解读
  14. 攻击arXiv:2609.33910 · 56

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    作者对长生命周期智能体测试残余权限重放,在Terminal-Bench上使代码智能体ASR平均增加24.9个百分点。

    • 35.1 ppGemini-3.1-Flash-Lite在AgentDojo(h=64)相比新鲜状态的ASR增量
    • 24.9 pp三款生产智能体在 Terminal-Bench 55 个案例上的平均 ASR 增量
    • 1.00Goose 在单个良性任务后 (h=1) 的条件历史暴露率 CHE (Figure 2)
    6 问速览长生命周期智能体中持久化授权脱离了原始上下文,使先前由用户批准的残余权限可能被重放用于未经确认的恶意操作。
    1. 这篇论文试图解决什么问题?

      长生命周期智能体中持久化授权脱离了原始上下文,使先前由用户批准的残余权限可能被重放用于未经确认的恶意操作。

    2. 有哪些相关研究?

      论文梳理了长生命周期智能体持久化状态、授权范围与时效约束、间接提示注入与执行上下文重绑定三类相关研究并确立定位。

    3. 论文如何解决这个问题?

      论文将残余权限重放形式化为逆向规划问题,通过授权画像分析、恶意动作逆向推导、良性权限收集与上下文对抗重放四个阶段实施。

    4. 论文做了哪些实验?

      在508个AgentDojo和55个Terminal-Bench案例上评测,历史权限使ASR最高提升35.1百分点,真实智能体平均增加24.9百分点。

    5. 有什么可以进一步探索的点?

      作者指出未来需探索跨异构工具的上下文绑定防御机制,且需平衡重用效率与安全性。

    6. 总结一下论文的主要内容

      论文分析了长生命周期智能体持久化授权被恶意重放的风险,实验中历史授权提高了攻击成功率,作者提出了上下文绑定防御方向。

    完整解读
已经到底了