跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 7 篇
  1. 攻击arXiv:2610.04589 ·

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    用StegoMemory测试智能体持久记忆作为跨会话隐写信道的可行性

    测试
    DeepSeek-V3、DeepSeek-R1、Llama 3.1 405B 等 13 个应用层
    场景
    AI Agent
    摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
    • 论文定位:论文提出了 StegoMemory,系统评测大语言模型智能体持久化记忆被用作跨会话隐写隐蔽通信信道的安全风险。
    • 解决的核心问题:现有安全评估主要关注显式有害内容与提示词注入,忽视了攻击者利用良性交互在记忆中隐写编码并跨会话重构机密的信息流威胁。
    • 方法核心要点:通过主副任务配对与两会话隔离协议,测试 7 种隐写机制在 13 个模型中的编码、记忆写入持久化及后续良性检索恢复全流程,并配合任务完成与安全合规监视。
    • 主要实验发现:
      1. 在全基准 14,000 次试验中,20.1% 实现了合成机密的确切匹配恢复,且其中 71.4% 同时通过任务完成与独立安全监视(占全试验的 14.4%)。
      2. 13 个模型中有 12 个显示信息损耗集中在记忆写入持久化阶段而非检索阶段(写入阶段存活率为 29.8%,检索可恢复为 25.4%)。
      3. 模型低拒答率不等于高正确编码率,较弱模型在未拒答时大量产生格式错误编码(全模型平均格式错误率为 23.5%,拒答率为 20.6%)。
    • 作者结论与防御启示:作者认为持久化记忆应被视作安全边界而非被动存储介质,单靠表面响应监视无法保证信息流安全,防御应优先部署在记忆写入接口处,实施出处追踪、规范化与跨会话信息流审计。
    完整解读
  2. 攻击arXiv:2609.18217 ·

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    提出跨通道分段攻击,借MCP多通道隐式信任外发敏感数据

    测试
    DeepSeek-V3、GPT-4o、GPT-4o-mini 等 15 个应用层
    摘要论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
    • 定位与核心问题:本研究系统评估了MCP工具调用流水线中的输入信任问题,针对所有通道共享单一上下文且缺乏权限隔离的设计弱点,探索恶意MCP服务器如何利用多通道实施凭证外发。
    • 方法核心要点:通过受控测试5个输入通道与6种载荷构架建立了模型的隐式信任画像;提出双通道与三通道分段攻击,将恶意模式与映射指令分散在工具描述与工具结果等不同通道;针对强抵御模型设计了符合工具声明目的的价值对齐利用,以及利用VS Code采样接口注入配置提示词的系统提示词覆盖攻击。
    • 关键实验结果:
      1. 双通道分段攻击使12个模型的平均遵从率从单通道的42%上升至82%,使GPT-4o、Gemini Flash与Llama 70B从0%遵从跃升至100%(Table IV)。
      2. 三通道分段攻击使在单通道和双通道下完全防御的Claude Haiku 4.5在Cursor中遵从率达到100%(20/20)(Table IV)。
      3. 针对抵御所有分段攻击的Sonnet 4.6与Opus 4.6,泄露凭证扫描器在Cursor中实现了20/20与18/20的.env文件外发(Table V)。
      4. 受测的7款主流第三方MCP安全工具对两通道与三通道分段攻击的检出率均为0%(Table IX)。
    • 作者结论与启示:作者认为模型的安全性不仅取决于训练对齐,更是模型与具体部署环境(如客户端系统提示词)交互的产物;现有多通道共享上下文且无特权分级的架构存在根本性安全缺陷,亟需在客户端实施通道特定的输入清洗、严格的工具参数类型约束以及跨通道安全感知训练。
    完整解读
  3. 攻击arXiv:2608.09867 ·

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    测试
    DeepSeek-V4-Flash、Claude Opus 4.8、Claude Sonnet 4.6 等 15 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
    • 论文定位:本文揭示了主流商业大模型 API(Anthropic、OpenAI、Google)用于维护无状态架构的客户端加密思维链数据块存在跨会话、跨用户与跨模型的系统性互换漏洞。
    • 要解决的问题:厂商为了保护商业知识产权并防范有害信息外泄而隐藏思维链,但在生态内部广泛启用了宽松的加密块兼容性,使得强模型的内省对齐防线因同厂商弱模型的安全不对称性而面临被击穿的风险。
    • 方法核心机制:提出了一种基于弱模型充当模糊解密器的解密越狱方法;攻击者将强模型生成的加密签名注入同厂商低成本且防御宽松的弱模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)中,利用输出预填或针对性提示词诱导其将加密内容逐字转写为明文,必要时结合强模型进行去噪调和。
    • 核心实验发现:
      1. 在 120 道 Codeforces 题目上,解密生成的 token 数量与 API 报告的原始计费思维 token 数量呈 1:1 紧密追踪(Figure 1)。
      2. 从公开抓取的 6,708 条智能体交互日志(315,320 个加密块)中解密出 941 项独立敏感伪影,从真实用户会话中恢复出 62 个 API 密钥、33 个密码等凭证,其中 64 项仅存在于加密思维而在可见聊天记录中已被用户清洗(Table 4)。
      3. 成功演示了将 HarmBench 恶意请求的隐藏思考还原为未审查输出,以及将恶意备份指令隐藏于加密块向 GPT-5.6 Sol 和 Opus 4.7 实施隐蔽提示词注入(Section 3.2、Section 4.2)。
      4. 预填 1% 的 Opus 4.8 思维可使 Kimi-K3 在 HLE STEM 题目上的最佳可见回答 n-gram 重叠度从 0.160 上升至 0.305(Table 3)。
    • 作者结论与启示:当前将加密数据对用户保密却对第三方缺乏防重放保护的设计无法保障隐私与安全;作者建议采用服务端存储的有状态架构,或在 AEAD 关联数据中强制绑定用户与会话哈希链,并呼吁行业重视多模型生态中弱模型的对齐短板。
    完整解读
  4. 攻击arXiv:2607.05189 ·

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    提出MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆

    测试
    DeepSeek v4 Flash、GPT-5.4、Claude Sonnet 4.6 等 6 个应用层
    场景
    AI Agent
    摘要总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。

    完整解读
  5. 防御arXiv:2609.14003 ·

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个应用层
    场景
    AI Agent
    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。
    • 研究定位:该研究针对个人大模型智能体在协作交互中的隐私保护问题,揭示了依赖提示词进行内部推理防御的结构性脆弱性,并提出了基于信息流控制的系统层防御。
    • 核心问题:现有防御将隐私判断交由智能体在攻击者可控的对话上下文中进行,使得防御执行点与攻击面重合,攻击者可通过任务重构(CWL)、省略披露(SOA)和跨通道解耦(CDA)绕过检查。
    • 防御机制:FLOWSEAL基于数据溯源对敏感记录打标,在工具调用边界部署独立代码拦截器执行三级格策略,并借助隔离的LLM内容检查器做语义去分类,辅以协作API引导智能体正常交互。
    • 关键实验结果:在SPR基准(DeepSeek-V3.2)上,FLOWSEAL将CWL的条目泄漏率从SPR-D2的52.2%降至0.5%,SOA从75.6%降至2.3%,CDA从43.8%降至2.2%;良性任务实用率保持在72.4%;在真实Gmail与Notion的MCP测试中将SOA泄漏率降至0.0%。
    • 消融与开销:工具拦截器是防御核心(禁用后CWL泄漏率回升至28.4%);相较无防御设置,FLOWSEAL每轮仅增加0.017美元成本与37%的延迟。
    • 作者结论与启示:作者认为,通过将安全执行移至对抗性重构无法触及的外部层,智能体可以获得更稳定的隐私保护,未来需推动操作系统、工具层与模型对齐的多层纵深防御。
    完整解读
  6. 攻击arXiv:2609.13889 ·

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    提出PMPA,诱导智能体把外部恶意指令写入持久记忆并跨会话泄露隐私

    测试
    DeepSeek-V4-Flash、DeepSeek-V4-Pro、Qwen3-Max应用层
    摘要论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。
    • 论文定位:该研究探讨了基于 harness 架构的智能体在持久记忆机制下所面临的新型跨会话安全与隐私风险。
    • 研究问题:现有提示注入多局限于单次会话,而传统后门攻击往往依赖较强的访问权限;论文研究在攻击者无法直接访问智能体的前提下,嵌入外部源的恶意指令能否诱导智能体将其持久化并引发跨会话隐私泄露。
    • 攻击方法:提出的 PMPA 采用两阶段流程,在注入阶段将包含过渡句、记忆写入指令和条件恶意规则的三组件载荷置于外部良性内容中,诱导智能体在问答时写入持久记忆;在触发阶段,用户执行正常工作区任务时激活存储的恶意规则,实现隐私窃取。
    • 核心实验发现:
      1. 在全场景平均下,OpenClaw 的 ISR 与 C-ASR 分别达到 73.7% 和 55.5%,Claude Code 对应达到 66.9% 和 81.7%,且良性任务 Utility 均保持在 80% 以上(摘要及 Table 1)。
      2. 文本模态的攻击效果高于多模态输入,OpenClaw 上文本输入的 ISR 达到 99.4 ± 0.8%,而图像与 PDF 的 ISR 分别为 54.5 ± 2.2% 与 67.2 ± 11.6%(Table 2)。
      3. 日历场景在两个系统上均取得突出的跨会话攻击效果,Claude Code 与 OpenClaw 的 C-ASR 分别达到 96.7 ± 4.7% 和 87.8 ± 9.5%(Table 3)。
      4. 三明治提示词防御能有效降低图像与 PDF 的注入率(如 Claude Code 图像 ISR 从 65.6% 降至 2.2%),但在日历场景中一旦记忆被投毒,Claude Code 的 C-ASR 仍维持在 96.7% 不变(Table 6)。
    • 作者结论与启示:作者认为持久记忆机制打破了单任务交互的安全边界,未经验证的外部数据可能使智能体形成长期的恶意潜伏行为;作者指出当前的提示级防御难以抵御已持久化的记忆投毒,智能体安全亟需从架构与记忆管理机制层面设计更有效的防护方案。
    完整解读
  7. 攻击arXiv:2609.36941 ·

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据

    测试
    DeepSeek-Coder-7B、LLaMA-3-8B、Qwen2.5-Coder-7B 等 8 个模型层
    场景
    模型与 API攻击者黑盒
    摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。
    • 定位与核心问题:针对黑盒商业大语言模型仅暴露生成文本且隐藏内部概率分布的限制,解决缺乏精确训练上下文时提取模型记忆的高熵 API key 的安全风险。
    • 两阶段方法框架:第一阶段利用注释编辑、死代码注入等 5 种语义保留代码变换扰动输入前缀,结合格式与长度双层过滤,通过硬标签响应蒸馏将黑盒模型的有效凭据输出迁移至本地白盒代理模型;第二阶段舍弃耗时的奖励模型,在白盒代理上通过 Sample-k%p 截断采样扩展候选空间,并基于最小窗口熵和 4-gram 重复子串抑制离线过滤幻觉凭据。
    • 凭据恢复效果:在 5 个 API 平台的受控评测中,针对 DeepSeek-Coder-7B、Qwen2.5-Coder-7B 和 LLaMA-3-8B 三大受害模型,平均恢复的真实凭据数量相较直接查询基线提升 11.8%–25.0%,分别达到 35.0、35.0 和 49.4 个(Table 1)。
    • 候选质量与多样性:在弱扰动条件下真实凭据比例(RR)相比白盒基线 DESEC 提升最高达 2.6 倍(Table 2),prompt 内候选凭据的余弦相似度和 3-gram Jaccard 相似度显著降低(Table 3)。
    • 推断效率提升:将过滤与排序转移至本地离线后,单次提取延迟降至 210–454 秒,较 token 级引导解码的 DESEC 提速 20.7 倍至 34.8 倍(Figure 3)。
    • 真实商业系统验证:在未接触模型权重的情况下,成功从 Qwen3-27B、GPT-Codex 5.3 和 Claude Haiku 4.5 中提取出多条凭据,并在 GitHub 上检索到公开匹配记录(Figure 4)。
    • 作者结论与启示:作者指出,实验表明 output-only 访问权限足以暴露黑盒模型记忆的机密凭据,构成现实的安全威胁,呼吁业界在预训练前执行更严格的数据清洗以避免敏感信息记忆。
    完整解读
已经到底了