跳到正文
10月8日 · 周四

提示注入 · 论文

找到 7 篇
  1. 攻击arXiv:2609.01222 ·

    研究者提出上下文权限提升攻击,12 款 Agent 框架均受影响

    提出上下文特权提升攻击,借助记忆、技能与仓库内容操纵编程智能体

    测试
    GPT-5.5、GPT-5.4 mini、Claude-Sonnet-4.6 等 7 个应用层
    摘要论文系统揭示了 12 个智能体 Harness 的特权提升缺陷,提出 16 种攻击向量并通过工具 CORA 验证了广泛存在的安全风险。

    本文系统分析了真实世界 AI 智能体 Harness 上下文组装机制的安全性。

    完整解读
  2. 攻击arXiv:2608.23858 ·

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    系统分析智能体支付协议AP2,揭示合法签名无法阻止前置上下文操纵

    测试
    gpt-5.3、gpt-5.5应用层
    场景
    AI Agent
    摘要系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    本文针对Google智能体支付协议AP2 v0.2展开了系统性安全分析,揭示了密码学签名在智能体前置操作上下文遭到篡改时的安全局限。

    完整解读
  3. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
  4. 攻击arXiv:2608.30441 ·

    ECLIPSE:针对长程 Agent 系统的自演化隐蔽提示注入攻击

    提出ECLIPSE双通道自演化提示注入,劫持长程智能体动作轨迹

    测试
    DeepSeek、GPT-4o、Claude 4.8 Opus 等 7 个应用层
    场景
    AI Agent攻击者黑盒
    摘要论文提出结合用户端与工具端注入的框架 ECLIPSE,在长任务基准上达成高成功率,揭示了长时程智能体面临的新安全挑战。
    • 研究定位:针对基于大语言模型、需要多步工具调用的长任务智能体系统,研究兼顾高隐蔽性与执行可控性的新型提示词注入攻击机制与评测基准。
    • 核心解决问题:化解现有直接注入因意图过于显式易被安全审查拦截、而分布式间接注入因长序列累积误差导致执行脱轨的固有矛盾。
    • 方法关键设计:提出 ECLIPSE 框架,在离线沙盒中利用影子智能体合成并双阶段验证工具链,渲染为自然的单轮隐蔽用户请求;在工具侧通过静态工作流编码(SWE)改写描述建立状态依赖,并利用动态轨迹校正(DTC)在执行偏离时注入残差修正信号。
    • 关键定量成果:在自建的 120 项长任务基准 LASE-Bench 上,ECLIPSE 对 DeepSeek 的无防御 ASR 达 96.7%、在外部安全过滤下达 69.2%(高出最强基线 27.5 个百分点,Table 2);在 Claude 4.8 Opus 带防御下达 62.4%(最强基线仅 0.8%,Table 2);在最新闭源模型 GPT-5.6 Luna 和 Claude Sonnet 5 带防御下分别达 52.5% 与 60.0%(Table 3)。
    • 迁移性与防御表现:在原生智能体系统 OpenClaw 与 Hermes 上,带防御 ASR 分别达到 61.7% 与 55.8%(Table 6、7);而在面对输入审查、工具边界隔离与轨迹监控防御时,仍能维持 43.3%–85.8% 的 ASR(Figure 6)。
    • 作者结论与启示:作者认为单点或局部的输入与工具过滤难以防范此类将恶意意图跨输入端、工具元数据与多步执行轨迹解耦的攻击,未来的智能体安全防御必须具备跨越多个信息源联合推理的能力。
    完整解读
  5. 攻击arXiv:2609.22510 ·

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个应用层
    场景
    AI Agent
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    完整解读
  6. 攻击arXiv:2609.33628 ·

    用课程强化学习对前沿模型做提示注入红队测试

    提出跨目标课程强化学习,生成间接提示注入以劫持智能体

    测试
    Qwen3-4B-Instruct-2507、GPT-4o-mini、GPT-5-nano 等 14 个应用层
    场景
    AI Agent
    摘要提出跨目标模型课程强化学习,攻破前沿模型冷启动瓶颈并实现跨模型迁移。

    该研究针对强化学习自动化提示注入红队在攻击前沿大模型时的冷启动问题,提出了一种基于目标模型鲁棒性递进的课程强化学习方法。

    完整解读
  7. 攻击arXiv:2609.33910 ·

    论文提出残留授权重放攻击:长期运行 Agent 的授权可跨任务复用

    提出残余权限重放攻击,跨任务复用已批准授权绕过确认

    测试
    GPT-4.1、Gemini-3.1-Flash-Lite、Qwen3-14B 等 9 个应用层
    摘要论文分析了长生命周期智能体持久化授权被恶意重放的风险,实验中历史授权提高了攻击成功率,作者提出了上下文绑定防御方向。
    • 研究定位:针对长生命周期智能体中用户批准持久化存储带来的安全隐患,论文提出了残余权限重放(Residual-Authority Replay)攻击框架。
    • 核心问题:传统权限控制存在时序盲区,用户在良性上下文中做出的单次批准被转化为长期生效的机器规则后,脱离了原有的任务背景,形成可被后续攻击无感复用的残余权限。
    • 方法设计:通过逆向分析智能体授权机制与代码实现,先推导出攻击目标所需的敏感操作权限,再利用良性交互诱导用户合法批准并持久化该权限,最后在对抗性上下文下触发目标动作并重放权限绕过确认。
    • 关键实验结果:在 508 个 AgentDojo 案例中,良性历史授权使受影响模型在 h=64 时的 ASR 达到 0.114–0.351(相比新鲜状态下的 0.000),其中 Gemini-3.1-Flash-Lite 增幅达 35.1 个百分点;在 55 个 Terminal-Bench 真实案例中,三款代码智能体的 ASR 平均增加 24.9 个百分点。
    • 细粒度与防御表现:将授权精确至具体资源时仍存在 0.012–0.039 的 ASR,而任务感知防御 Progent 将 ASR 压制在 0.009 以下,PAuth 与禁止重放策略可将 ASR 降为 0。
    • 结论与启示:作者指出持久化授权有损地编译了人类同意,单纯收紧匹配粒度无法根除授权与执行在时间上的脱节,未来的智能体授权机制需要在保留复用效率的同时对上下文环境绑定进行动态重新验证。
    完整解读
已经到底了