跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 2 篇
  1. 攻击arXiv:2610.09027 ·

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个基础设施层
    摘要论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。
    • 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
    • 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
    • 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
    • 核心实验结果:
      • 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
      • 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
      • 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
    • 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。
    完整解读
  2. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
已经到底了