跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 10 篇
  1. 攻击arXiv:2604.02623 ·

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    提出eTAMP,通过网页注入跨会话污染Web智能体轨迹记忆

    测试
    Qwen2.5-VL-72B、Qwen3-VL-32B、Qwen3.5-122B-A10B 等 7 个应用层
    摘要论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。

    完整解读
  2. 攻击arXiv:2610.09920 ·

    研究:多向量视觉文档索引可被反演还原页面内容

    提出流匹配逆向框架,从多向量视觉文档索引重构页面

    测试
    Tomoro-ColQwen3-8B、ColQwen3.5-4.5B、Tomoro-colqwen3-embed-4b 等 13 个应用层
    摘要揭示多视觉文档索引存在逆向风险,原始索引达98.4%重识别且打乱防护可被攻破。

    本文针对多向量视觉文档检索器的索引安全性展开研究,证明了仅凭第三方向量库中存储的多向量索引,在零侧信息下即可逆向恢复出包含清晰文字和排版的原始文档图像。

    完整解读
  3. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    Qwen2.5-72B、Llama 3.1 405B、Claude 3.5 Sonnet 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  4. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    Qwen-2.5-72B、GPT-4o、GPT-4o-mini 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  5. 攻击arXiv:2610.01365 ·

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出ReGap,用自生成伪监督微调恢复模型中的隐私关联

    测试
    Qwen3-1.7B、Qwen3-4B、GPT-2 Small 等 6 个训练与数据层
    场景
    模型与 API攻击者白盒灰盒
    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
    • 一句话定位:研究大语言模型在后训练导致隐私可访问性下降后,能否在无外部真实私有监督下通过微调恢复先前习得的私有实体-属性关联。
    • 核心问题与动机:现有恢复攻击通常假设攻击者持有训练集同分布的真实私有参考数据,但在仅获发布模型的实际场景中该假设难以成立;作者探究模型能否仅凭自身生成的数据唤醒隐性隐私记忆。
    • 方法核心:提出数据无关的 ReGap 攻击框架,通过冻结目标模型生成候选补全,依据答案 token 负对数似然挑选 top-K 高支持度样本,利用轻量化 LoRA 微调促使模型更新并降低目标损失。
    • 主要实验发现:
      • 在 GPT-2、OPT 和 Qwen3 的 6 个模型设置中,单轮 ReGap 将目标关联恢复率提升 6 到 21 个百分点(Figure 2),在 GPT-2 Medium 上从 42.0% 升至 63.0%。
      • 未见身份对照中,使用完全不相交的人名仍能在 GPT-2 Medium 上取得 15.3 个百分点的恢复增益,且生成池和选定监督中确切目标答案命中数为 0(Table 1、Table 22)。
      • 先验暴露对照中,同一适配器转移至未暴露于目标的同构模型上恢复率维持 13.0% 无增益,表明恢复增益强烈依赖于历史训练暴露而非微调自身伪造记忆(Table 3)。
      • 边界测试表明,在消除语义规律的不透明随机绑定和显式 NPO 遗忘模型上,ReGap 几乎无法产生额外恢复增益(Table 17、Table 19)。
    • 作者结论与启示:作者指出直接查询不可得并不意味着记忆已真正被抹除,常规的下游微调和自生成数据可能重新唤醒潜在的隐私风险,呼吁在模型发布后全生命周期中持续评估隐私安全。
    完整解读
  6. 攻击arXiv:2609.04382 ·

    研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过

    揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容

    测试
    Qwen3-0.6B、35B-A3B训练与数据层
    场景
    模型与 API攻击者白盒
    摘要论文揭示拆分训练中反向梯度零支撑完全暴露诱饵行,联合视图突破门控,裁剪加噪可有效缓解。

    这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。

    完整解读
  7. 攻击arXiv:2609.04533 ·

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    测试
    Qwen3.6-27B、Qwen3-VL-32B-Instruct、Qwen3-VL-4B-Instruct 等 11 个应用层
    场景
    AI Agent
    摘要论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。
    1. 研究定位与核心问题:论文针对多模态AI智能体面临的非受信数据威胁,研究在良性用户任务竞争与黑盒API访问条件下,如何仅通过外部图像输入诱导前沿VLM执行盗取隐私与原生工具调用等实质危害行为。
    2. 方法设计要点:作者提出Repeat-After-Me(RAM)框架,将攻击从意图覆盖转换为响应前缀控制,在图像顶部渲染前缀诱导语句;利用Claude-Opus-4.6作为攻击与评审LLM开展黑盒自适应迭代精炼,并构建包含32种改写模式的攻击库以加速搜索。
    3. 主实验与迁移表现:在DocVQA良性任务下,RAM在Steal-PII场景对四款VLM实现不低于99%的ASR(Table 2);在Call-Tool场景对GPT-5.5和Claude-Opus-4.7达到47% ASR,对Qwen3.6-27B达到96%(Table 2);针对Claude-Opus-4.7优化的攻击在GPT-5.5上迁移保留率为43%(Table 3)。
    4. 真实智能体越权验证:在OpenClaw智能体评估中,纯文本提示注入在GPT-5.5上ASR为0%,而RAM图文混合注入对GPT-5.5和Gemini-3.1-Pro分别取得90%和100%的ASR(Table 4),在真实Discord测试中通过改写TOOLS.md实现了未授权代码执行。
    5. 防御评估与作者启示:基础防御性提示词、图像模糊与OCR过滤均无法在各模型上普遍消除攻击,如Unfiltered OCR + Sandwich在GPT-5.5上仍有21% ASR(Table 10);作者认为前沿VLM尚未配备充分的视觉安全防线,智能体安全评估必须引入针对视觉通道的自适应自动化红队测试。
    完整解读
  8. 攻击arXiv:2609.13889 ·

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私

    测试
    Qwen3-Max、DeepSeek-V4-Flash、DeepSeek-V4-Pro应用层
    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
    • 论文定位:该研究探讨了基于 harness 架构的智能体在持久记忆机制下所面临的新型跨会话安全与隐私风险。
    • 研究问题:现有提示注入多局限于单次会话,而传统后门攻击往往依赖较强的访问权限;论文研究在攻击者无法直接访问智能体的前提下,嵌入外部源的恶意指令能否诱导智能体将其持久化并引发跨会话隐私泄露。
    • 攻击方法:提出的 PMPA 采用两阶段流程,在注入阶段将包含过渡句、记忆写入指令和条件恶意规则的三组件载荷置于外部良性内容中,诱导智能体在问答时写入持久记忆;在触发阶段,用户执行正常工作区任务时激活存储的恶意规则,实现隐私窃取。
    • 核心实验发现:
      1. 在全场景平均下,OpenClaw 的 ISR 与 C-ASR 分别达到 73.7% 和 55.5%,Claude Code 对应达到 66.9% 和 81.7%,且良性任务 Utility 均保持在 80% 以上(摘要及 Table 1)。
      2. 文本模态的攻击效果高于多模态输入,OpenClaw 上文本输入的 ISR 达到 99.4 ± 0.8%,而图像与 PDF 的 ISR 分别为 54.5 ± 2.2% 与 67.2 ± 11.6%(Table 2)。
      3. 日历场景在两个系统上均取得突出的跨会话攻击效果,Claude Code 与 OpenClaw 的 C-ASR 分别达到 96.7 ± 4.7% 和 87.8 ± 9.5%(Table 3)。
      4. 三明治提示词防御能有效降低图像与 PDF 的注入率(如 Claude Code 图像 ISR 从 65.6% 降至 2.2%),但在日历场景中一旦记忆被投毒,Claude Code 的 C-ASR 仍维持在 96.7% 不变(Table 6)。
    • 作者结论与启示:作者认为持久记忆机制打破了单任务交互的安全边界,未经验证的外部数据可能使智能体形成长期的恶意潜伏行为;作者指出当前的提示级防御难以抵御已持久化的记忆投毒,智能体安全亟需从架构与记忆管理机制层面设计更有效的防护方案。
    完整解读
  9. 攻击arXiv:2609.36941 ·

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据

    测试
    Qwen2.5-Coder-7B、Qwen3-27B、DeepSeek-Coder-7B 等 8 个模型层
    场景
    模型与 API攻击者黑盒
    摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
    • 定位与核心问题:针对黑盒商业大语言模型仅暴露生成文本且隐藏内部概率分布的限制,解决缺乏精确训练上下文时提取模型记忆的高熵 API key 的安全风险。
    • 两阶段方法框架:第一阶段利用注释编辑、死代码注入等 5 种语义保留代码变换扰动输入前缀,结合格式与长度双层过滤,通过硬标签响应蒸馏将黑盒模型的有效凭据输出迁移至本地白盒代理模型;第二阶段舍弃耗时的奖励模型,在白盒代理上通过 Sample-k%p 截断采样扩展候选空间,并基于最小窗口熵和 4-gram 重复子串抑制离线过滤幻觉凭据。
    • 凭据恢复效果:在 5 个 API 平台的受控评测中,针对 DeepSeek-Coder-7B、Qwen2.5-Coder-7B 和 LLaMA-3-8B 三大受害模型,平均恢复的真实凭据数量相较直接查询基线提升 11.8%–25.0%,分别达到 35.0、35.0 和 49.4 个(Table 1)。
    • 候选质量与多样性:在弱扰动条件下真实凭据比例(RR)相比白盒基线 DESEC 提升最高达 2.6 倍(Table 2),prompt 内候选凭据的余弦相似度和 3-gram Jaccard 相似度显著降低(Table 3)。
    • 推断效率提升:将过滤与排序转移至本地离线后,单次提取延迟降至 210–454 秒,较 token 级引导解码的 DESEC 提速 20.7 倍至 34.8 倍(Figure 3)。
    • 真实商业系统验证:在未接触模型权重的情况下,成功从 Qwen3-27B、GPT-Codex 5.3 和 Claude Haiku 4.5 中提取出多条凭据,并在 GitHub 上检索到公开匹配记录(Figure 4)。
    • 作者结论与启示:作者指出,实验表明 output-only 访问权限足以暴露黑盒模型记忆的机密凭据,构成现实的安全威胁,呼吁业界在预训练前执行更严格的数据清洗以避免敏感信息记忆。
    完整解读
  10. 攻击arXiv:2609.33985 ·

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个训练与数据层
    场景
    模型与 API攻击者黑盒
    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。
    • 论文定位:本文揭示了众包监督微调(SFT)中低预算数据中毒放大提取他人专有微调指令的隐私风险。
    • 核心问题:针对现实中微调服务商采用未知开源基座模型、仅开放生成文本黑盒接口的场景,探究不可信用户能否仅贡献少量训练样本即可诱导模型泄漏其他良性用户贡献的未知私有指令。
    • 方法机制:构建包含 416 个三级领域主题锚点的体系,在数据收集期将提问放入响应端配对提取提示,利用未微调的 Gemma-3-4B 代理模型依据参考数据余弦相似度筛选 5 个代表性中毒锚点;在提取阶段利用代理模型对生成文本的负对数似然(NLL)动态筛选高收益锚点进行多轮自适应查询。
    • 关键实验结果:仅需注入 50 条中毒样本(微调集约 1%),Qwen2.5-14B 在 OpenMathInstruct 上的近原样提取率即达 8.84%(为良性微调 2.38% 的 3.71 倍),Llama-3.1-8B 在 AceReason 上达 5.85%(为良性微调 1.90% 的 3.08 倍)(Table 13);在默认 100 条中毒设定下,该攻击在多项指标上超过了控制 49% 后门数据的提供商后门基线(Table 1)。
    • 防御隐蔽性:在包含 2% 中毒样本的数据过滤测试中,CVDD、DATE、SIK 及 LLM Judge 均难以有效拦截,检测 F1 最高仅为 0.378(CVDD 作用于回复端),其余多数配置召回为 0(Table 4)。
    • 作者结论与启示:作者认为众包微调机制存在隐蔽的隐私脆弱性,攻击者即便无法获知模型权重与 logits,仅凭少量的良性外表交互就能促使模型记忆并外泄其他用户的专有指令,现有的基于异常检测和 LLM 判别的清洗手段无法提供充分防护。
    完整解读
已经到底了