跳到正文
10月8日 · 周四

提示注入 · 论文

找到 14 篇
  1. 防御arXiv:2609.11757 ·

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    提出A-VIP,将购物意图绑定到支付授权以阻断商户文本操控

    测试
    gemini-2.5-flash-lite、gemini-3.1-flash-lite、gemini-3-flash-preview 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。
    • 定位与目标:本文针对智能体支付协议 AP2,研究商户利用商品描述影响智能体决策的推理层攻击面,并提出了协议层绑定防御机制 A-VIP 与评测基准 AP2-WhisperBench。
    • 要解决的问题:现有支付协议的密码学签名仅能证明交易未被篡改,但未约束生成交易的决策推理;商户在商品描述中植入不含违规指令的事实性断言即可左右购物结果,且生成的购物车完全符合协议校验。
    • 方法要点:A-VIP 将用户签名意图转变为权能授权。针对凭据泄漏(Vault Whisper),引入 DDFC 使用单次会话令牌替代用户标识符;针对购物车篡改(Branded Whisper),通过快照进行实体与展示的算术与标识比对;针对事实性诱导(Selection Whisper),通过与最低价基准比对将未授权支出露出给用户确认。
    • 关键实验发现:
      1. 在 AP2 默认的 Flash-Lite 预览模型上,Vault 与 Branded 攻击成功率分别达 90% 与 56%(Table 3);Selection 攻击在 GA 后续版本上达 73.3%(Table 3)。
      2. 事实性操纵在 17 个 Google 模型上成功率为 23.3% 至 73.3%(Table 4),在多厂商 27 个模型汇总达 71.8%(Section 7.4),仅 claude-opus-5 出现较低成功率(1.2%)。
      3. A-VIP 结构化检查以零假阳性闭环拦截了全部 7 类购物车篡改,并在 68 个被操纵购物车中 100% 露出了未授权支出(Table 11)。
      4. 辅助内容扫描器在 Intel i7 CPU 上单核达 1,932 次/秒,8 线程达 10,328 次/秒(Appendix C)。
    • 作者结论与启示:作者指出模型抵御能力与模型规模、厂商或定价无直接对应关系,支付协议设计者无法依赖下游模型自觉防御,必须在协议层将凭据、购物车与支出严格绑定到用户初始授权上。
    完整解读
  2. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  3. 攻击arXiv:2608.09867 ·

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 15 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
    • 论文定位:本文揭示了主流商业大模型 API(Anthropic、OpenAI、Google)用于维护无状态架构的客户端加密思维链数据块存在跨会话、跨用户与跨模型的系统性互换漏洞。
    • 要解决的问题:厂商为了保护商业知识产权并防范有害信息外泄而隐藏思维链,但在生态内部广泛启用了宽松的加密块兼容性,使得强模型的内省对齐防线因同厂商弱模型的安全不对称性而面临被击穿的风险。
    • 方法核心机制:提出了一种基于弱模型充当模糊解密器的解密越狱方法;攻击者将强模型生成的加密签名注入同厂商低成本且防御宽松的弱模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)中,利用输出预填或针对性提示词诱导其将加密内容逐字转写为明文,必要时结合强模型进行去噪调和。
    • 核心实验发现:
      1. 在 120 道 Codeforces 题目上,解密生成的 token 数量与 API 报告的原始计费思维 token 数量呈 1:1 紧密追踪(Figure 1)。
      2. 从公开抓取的 6,708 条智能体交互日志(315,320 个加密块)中解密出 941 项独立敏感伪影,从真实用户会话中恢复出 62 个 API 密钥、33 个密码等凭证,其中 64 项仅存在于加密思维而在可见聊天记录中已被用户清洗(Table 4)。
      3. 成功演示了将 HarmBench 恶意请求的隐藏思考还原为未审查输出,以及将恶意备份指令隐藏于加密块向 GPT-5.6 Sol 和 Opus 4.7 实施隐蔽提示词注入(Section 3.2、Section 4.2)。
      4. 预填 1% 的 Opus 4.8 思维可使 Kimi-K3 在 HLE STEM 题目上的最佳可见回答 n-gram 重叠度从 0.160 上升至 0.305(Table 3)。
    • 作者结论与启示:当前将加密数据对用户保密却对第三方缺乏防重放保护的设计无法保障隐私与安全;作者建议采用服务端存储的有状态架构,或在 AEAD 关联数据中强制绑定用户与会话哈希链,并呼吁行业重视多模型生态中弱模型的对齐短板。
    完整解读
  4. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    GPT-5.4、Claude Sonnet 4.6、Claude Sonnet 4.5 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  5. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  6. 攻击arXiv:2607.26115 ·

    OpenAI 发布 GPT-Red:通过自博弈训练自动化红队智能体

    提出自博弈红队智能体GPT-Red,自动挖掘提示注入与越狱攻击

    测试
    GPT-5.6、GPT-5.5、GPT-5.4 等 8 个应用层
    场景
    AI Agent攻击者黑盒
    摘要通过多防守者自博弈训练自主红队智能体GPT-Red,发现复杂漏洞并将GPT-5.6在Fake CoT下的鲁棒性提升至95.9%。
    • 一句话定位:提出了通过大规模自博弈强化学习训练的自主红队智能体 GPT-Red,并将其用于前沿大模型 GPT-5.6 的对抗鲁棒性训练。
    • 要解决的问题:现有大模型对抗训练依赖规模受限且静态的人类或提示驱动攻击数据,容易发生过拟合并被自适应攻击绕过,亟需具备自适应搜索与持续进化能力的自动化红队生成体系。
    • 方法要点:为攻击者提供 terminal 与 stateful defender_model 工具以支持推理期搜索;构建覆盖工具调用、本地文件、网页浏览和多模态渲染的现实红队强化学习环境;采用多防守者种群的自博弈强化学习训练,通过非对称奖励驱动攻防双方共同进化并防止策略坍缩。
    • 核心实验结果:
      1. 在 IPI Challenge 留存间接提示词注入任务上,GPT-Red 在 100x 计算量下 ASR 超过 80%,高于人类红队与 GPT-5.5 基线(Figure 1);
      2. 针对 OpenAI 办公室内真实 AI 自动售货机系统 Vendy,GPT-Red 达成了低价改价、高价新品下单和取消订单三项实际恶意目标(Figure 9,第 11 页);
      3. 引入 GPT-Red 样本进行对抗训练使 GPT-5.6 在 Fake CoT 攻击下的防御鲁棒性从 GPT-5.1 的 5.2% 提升至 95.9%(Figure 13),在留存攻击、数据集和领域的鲁棒性分别达到 72.0%、56.1% 和 89.1%(Figure 11)。
    • 作者结论与启示:作者认为攻防自博弈为模型安全提供了自我提升路径,但多模态、多轮对抗以及防范人类可能挖掘出的新攻击类别仍是未来持续探索的方向。
    完整解读
  7. 攻击arXiv:2608.23858 ·

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    系统分析智能体支付协议AP2,揭示合法签名无法阻止前置上下文操纵

    测试
    gpt-5.3、gpt-5.5应用层
    场景
    AI Agent
    摘要系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    本文针对Google智能体支付协议AP2 v0.2展开了系统性安全分析,揭示了密码学签名在智能体前置操作上下文遭到篡改时的安全局限。

    完整解读
  8. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
  9. 攻击arXiv:2609.09553 ·

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    测试
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个提示层
    场景
    模型与 API攻击者黑盒
    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
    • 研究定位:该研究展示了一种针对黑盒商业大模型的新型攻击向量,表明此前依赖微调接口的任意密码越狱已能直接通过常规对话接口实现。
    • 核心问题:现有防御依赖默认放行的有害性分类器,且既有研究认为未见密码无法直接在聊天中生效;作者试图验证前沿模型能否仅凭提示词掌握任意字母置换并突破安全对齐。
    • 方法设计:攻击通过提示词静态输入置换规则与加密问答对,利用上下文学习使模型掌握字符映射;方法包括全量单轮置换与基于词频递增的迭代算法,并在调用时关闭模型 reasoning 以防止其显式解密。
    • 关键实验发现:在 5 次采样评估中,Claude Sonnet 4 单轮攻击达到 100% ASR(7+ 置换);Gemini 3 Flash 迭代算法达到 100% ASR(10+ 置换);GPT 5.5 结合 crescendo 越狱达到 100% ASR;Claude Sonnet 4.5 定制置换下达到 80% ASR;而 GPT-4 等前代模型 ASR 均为 0%(Table I、II)。
    • 作者结论与启示:作者认为前沿模型能力的提升使得此前不可行的分布外通信成为现实,从而打开了新型攻击面;当前对齐在足够困难的通信任务下容易被旁路,强制启用 reasoning 或部署专门的隐蔽通信检测分类器是潜在的缓解途径(Section VII)。
    完整解读
  10. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
  11. 攻击arXiv:2609.13889 ·

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私

    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max应用层
    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
    • 论文定位:该研究探讨了基于 harness 架构的智能体在持久记忆机制下所面临的新型跨会话安全与隐私风险。
    • 研究问题:现有提示注入多局限于单次会话,而传统后门攻击往往依赖较强的访问权限;论文研究在攻击者无法直接访问智能体的前提下,嵌入外部源的恶意指令能否诱导智能体将其持久化并引发跨会话隐私泄露。
    • 攻击方法:提出的 PMPA 采用两阶段流程,在注入阶段将包含过渡句、记忆写入指令和条件恶意规则的三组件载荷置于外部良性内容中,诱导智能体在问答时写入持久记忆;在触发阶段,用户执行正常工作区任务时激活存储的恶意规则,实现隐私窃取。
    • 核心实验发现:
      1. 在全场景平均下,OpenClaw 的 ISR 与 C-ASR 分别达到 73.7% 和 55.5%,Claude Code 对应达到 66.9% 和 81.7%,且良性任务 Utility 均保持在 80% 以上(摘要及 Table 1)。
      2. 文本模态的攻击效果高于多模态输入,OpenClaw 上文本输入的 ISR 达到 99.4 ± 0.8%,而图像与 PDF 的 ISR 分别为 54.5 ± 2.2% 与 67.2 ± 11.6%(Table 2)。
      3. 日历场景在两个系统上均取得突出的跨会话攻击效果,Claude Code 与 OpenClaw 的 C-ASR 分别达到 96.7 ± 4.7% 和 87.8 ± 9.5%(Table 3)。
      4. 三明治提示词防御能有效降低图像与 PDF 的注入率(如 Claude Code 图像 ISR 从 65.6% 降至 2.2%),但在日历场景中一旦记忆被投毒,Claude Code 的 C-ASR 仍维持在 96.7% 不变(Table 6)。
    • 作者结论与启示:作者认为持久记忆机制打破了单任务交互的安全边界,未经验证的外部数据可能使智能体形成长期的恶意潜伏行为;作者指出当前的提示级防御难以抵御已持久化的记忆投毒,智能体安全亟需从架构与记忆管理机制层面设计更有效的防护方案。
    完整解读
  12. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  13. 攻击arXiv:2609.33628 ·

    用课程强化学习对前沿模型做提示注入红队测试

    提出跨目标课程强化学习,生成间接提示注入以劫持智能体

    测试
    Qwen3-4B-Instruct-2507、GPT-4o-mini、GPT-5-nano 等 14 个应用层
    场景
    AI Agent
    摘要提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。

    完整解读
  14. 攻击arXiv:2609.33910 ·

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    提出残余权限重放攻击,跨任务复用已批准授权绕过确认

    测试
    GPT-4.1、Gemini-3.1-Flash-Lite、Qwen3-14B 等 9 个应用层
    摘要论文分析了长生命周期智能体持久化授权被恶意重放的风险,实验中历史授权提高了攻击成功率,作者提出了上下文绑定防御方向。
    • 研究定位:针对长生命周期智能体中用户批准持久化存储带来的安全隐患,论文提出了残余权限重放(Residual-Authority Replay)攻击框架。
    • 核心问题:传统权限控制存在时序盲区,用户在良性上下文中做出的单次批准被转化为长期生效的机器规则后,脱离了原有的任务背景,形成可被后续攻击无感复用的残余权限。
    • 方法设计:通过逆向分析智能体授权机制与代码实现,先推导出攻击目标所需的敏感操作权限,再利用良性交互诱导用户合法批准并持久化该权限,最后在对抗性上下文下触发目标动作并重放权限绕过确认。
    • 关键实验结果:在 508 个 AgentDojo 案例中,良性历史授权使受影响模型在 h=64 时的 ASR 达到 0.114–0.351(相比新鲜状态下的 0.000),其中 Gemini-3.1-Flash-Lite 增幅达 35.1 个百分点;在 55 个 Terminal-Bench 真实案例中,三款代码智能体的 ASR 平均增加 24.9 个百分点。
    • 细粒度与防御表现:将授权精确至具体资源时仍存在 0.012–0.039 的 ASR,而任务感知防御 Progent 将 ASR 压制在 0.009 以下,PAuth 与禁止重放策略可将 ASR 降为 0。
    • 结论与启示:作者指出持久化授权有损地编译了人类同意,单纯收紧匹配粒度无法根除授权与执行在时间上的脱节,未来的智能体授权机制需要在保留复用效率的同时对上下文环境绑定进行动态重新验证。
    完整解读
已经到底了