跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 2 篇
  1. 攻击arXiv:2610.09027 ·

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    测试
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B 等 4 个基础设施层
    摘要论文提出P-VMI,证实对抗输入被掩蔽后仍可经KV缓存持久控制模型,强调了保留状态的安全风险。
    • 一句话定位:本文研究了多模态模型中对抗输入在被从上下文中移除或掩蔽后,其攻击影响能否通过后续 token 的 KV 缓存持久存在。
    • 要解决的核心问题:现有智能体安全部署假定攻击严格依赖恶意输入在提示词中的实时呈现,上下文管理或安全过滤将其移除后即可消除风险;作者质疑了该假设在保留 KV 状态机制下的有效性。
    • 方法要点:提出了持久性攻击概念及 P-VMI 方法,通过结合首轮良性锚点监督与掩蔽后经由保留 KV 缓存反向传播的目标损失,使用 APGD 直接优化输入以将恶意指令隐蔽写入后续缓存。
    • 核心实验结果:
      • 在 Qwen3-VL-8B-Instruct 上,P-VMI 在注意力掩蔽下仍能达成最高约 90% 的目标成功率(Figure 4 中 party 达 0.92),而未优化的原始 VMI 成功率为 0%。
      • 在上下文压缩保留摘要 KV 缓存的设定下,即使图像仅在首轮出现且后续对话被丢弃,平均成功率仍达 70% 至 89%(Figure 7)。
      • 缓存交换因果消融显示固定文本时仅对抗缓存能触发攻击,且残差流单一线性方向能以 0.91 的合并 AUC 预测攻击成败(Figure 8)。
    • 作者的结论与启示:作者认为仅从提示词中移除不可信输入是不充分的,保留的 KV 状态构成了可被利用的攻击面;完全重新计算 KV 缓存虽能阻断该通道,但会牺牲保留缓存的效率收益,亟需针对保留状态安全性的新型防御机制。
    完整解读
  2. 攻击arXiv:2609.33985 ·

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个训练与数据层
    场景
    模型与 API攻击者黑盒
    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
    • 论文定位:本文揭示了众包监督微调(SFT)中低预算数据中毒放大提取他人专有微调指令的隐私风险。
    • 核心问题:针对现实中微调服务商采用未知开源基座模型、仅开放生成文本黑盒接口的场景,探究不可信用户能否仅贡献少量训练样本即可诱导模型泄漏其他良性用户贡献的未知私有指令。
    • 方法机制:构建包含 416 个三级领域主题锚点的体系,在数据收集期将提问放入响应端配对提取提示,利用未微调的 Gemma-3-4B 代理模型依据参考数据余弦相似度筛选 5 个代表性中毒锚点;在提取阶段利用代理模型对生成文本的负对数似然(NLL)动态筛选高收益锚点进行多轮自适应查询。
    • 关键实验结果:仅需注入 50 条中毒样本(微调集约 1%),Qwen2.5-14B 在 OpenMathInstruct 上的近原样提取率即达 8.84%(为良性微调 2.38% 的 3.71 倍),Llama-3.1-8B 在 AceReason 上达 5.85%(为良性微调 1.90% 的 3.08 倍)(Table 13);在默认 100 条中毒设定下,该攻击在多项指标上超过了控制 49% 后门数据的提供商后门基线(Table 1)。
    • 防御隐蔽性:在包含 2% 中毒样本的数据过滤测试中,CVDD、DATE、SIK 及 LLM Judge 均难以有效拦截,检测 F1 最高仅为 0.378(CVDD 作用于回复端),其余多数配置召回为 0(Table 4)。
    • 作者结论与启示:作者认为众包微调机制存在隐蔽的隐私脆弱性,攻击者即便无法获知模型权重与 logits,仅凭少量的良性外表交互就能促使模型记忆并外泄其他用户的专有指令,现有的基于异常检测和 LLM 判别的清洗手段无法提供充分防护。
    完整解读
已经到底了