跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2608.09867 ·

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    测试
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 15 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
    • 论文定位:本文揭示了主流商业大模型 API(Anthropic、OpenAI、Google)用于维护无状态架构的客户端加密思维链数据块存在跨会话、跨用户与跨模型的系统性互换漏洞。
    • 要解决的问题:厂商为了保护商业知识产权并防范有害信息外泄而隐藏思维链,但在生态内部广泛启用了宽松的加密块兼容性,使得强模型的内省对齐防线因同厂商弱模型的安全不对称性而面临被击穿的风险。
    • 方法核心机制:提出了一种基于弱模型充当模糊解密器的解密越狱方法;攻击者将强模型生成的加密签名注入同厂商低成本且防御宽松的弱模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6)中,利用输出预填或针对性提示词诱导其将加密内容逐字转写为明文,必要时结合强模型进行去噪调和。
    • 核心实验发现:
      1. 在 120 道 Codeforces 题目上,解密生成的 token 数量与 API 报告的原始计费思维 token 数量呈 1:1 紧密追踪(Figure 1)。
      2. 从公开抓取的 6,708 条智能体交互日志(315,320 个加密块)中解密出 941 项独立敏感伪影,从真实用户会话中恢复出 62 个 API 密钥、33 个密码等凭证,其中 64 项仅存在于加密思维而在可见聊天记录中已被用户清洗(Table 4)。
      3. 成功演示了将 HarmBench 恶意请求的隐藏思考还原为未审查输出,以及将恶意备份指令隐藏于加密块向 GPT-5.6 Sol 和 Opus 4.7 实施隐蔽提示词注入(Section 3.2、Section 4.2)。
      4. 预填 1% 的 Opus 4.8 思维可使 Kimi-K3 在 HLE STEM 题目上的最佳可见回答 n-gram 重叠度从 0.160 上升至 0.305(Table 3)。
    • 作者结论与启示:当前将加密数据对用户保密却对第三方缺乏防重放保护的设计无法保障隐私与安全;作者建议采用服务端存储的有状态架构,或在 AEAD 关联数据中强制绑定用户与会话哈希链,并呼吁行业重视多模型生态中弱模型的对齐短板。
    完整解读
  2. 攻击arXiv:2609.09553 ·

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    测试
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个提示层
    场景
    模型与 API攻击者黑盒
    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
    • 研究定位:该研究展示了一种针对黑盒商业大模型的新型攻击向量,表明此前依赖微调接口的任意密码越狱已能直接通过常规对话接口实现。
    • 核心问题:现有防御依赖默认放行的有害性分类器,且既有研究认为未见密码无法直接在聊天中生效;作者试图验证前沿模型能否仅凭提示词掌握任意字母置换并突破安全对齐。
    • 方法设计:攻击通过提示词静态输入置换规则与加密问答对,利用上下文学习使模型掌握字符映射;方法包括全量单轮置换与基于词频递增的迭代算法,并在调用时关闭模型 reasoning 以防止其显式解密。
    • 关键实验发现:在 5 次采样评估中,Claude Sonnet 4 单轮攻击达到 100% ASR(7+ 置换);Gemini 3 Flash 迭代算法达到 100% ASR(10+ 置换);GPT 5.5 结合 crescendo 越狱达到 100% ASR;Claude Sonnet 4.5 定制置换下达到 80% ASR;而 GPT-4 等前代模型 ASR 均为 0%(Table I、II)。
    • 作者结论与启示:作者认为前沿模型能力的提升使得此前不可行的分布外通信成为现实,从而打开了新型攻击面;当前对齐在足够困难的通信任务下容易被旁路,强制启用 reasoning 或部署专门的隐蔽通信检测分类器是潜在的缓解途径(Section VII)。
    完整解读
  3. 攻击arXiv:2609.29775 ·

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    提出推理通道预填与输出前缀组合攻击以越狱推理模型

    测试
    Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5提示层
    场景
    模型与 API攻击者黑盒
    摘要论文针对推理大模型评估输出前缀与草稿推理注入,发现二者协同可推高 ASR,同时指出安全防护能够在系统层面解决该漏洞。
    • 研究定位:作者称本研究是首个针对大模型草稿推理通道系统开展的受控输出前缀攻击实验,评估了暴露推理与隐藏推理两种框架下的安全对齐表现。
    • 解决的问题:随着推理大模型成为主流,部分 API 暴露了可由用户写入的草稿推理字段,研究旨在探明前缀注入攻击在推理模型上的有效性,以及中间推理究竟充当了安全缓冲还是引入了新的攻击面。
    • 方法核心要点:研究采用 3×2 析因设计,对比无前缀、静态顺从前缀与针对性上下文前缀,以及注入与不注入由开源无审查模型生成的恶意推理草稿;对隐藏推理模型则在输出前缀中伪造思考标签进行测试。
    • 关键实验结果:在 AdvBench 的 100 个提示词测试中,单独注入恶意推理在三款模型上均接近无效(ASR 均为 0% 或 1%);但当恶意推理与输出前缀结合时,Gemini 3 Flash Preview 的 ASR 升至 99%(策略 5),DeepSeek V4 Flash 的 ASR 升至 76%(策略 6,Table 3)。
    • 模型与框架防御差异:不同模型对前缀与推理注入的易感性差异明显,采用 Constitutional AI 对齐的 Claude Haiku 4.5 在全部 6 种策略下的 ASR 均不超过 1%(Table 3),体现出该漏洞在工程实践中具备可防御性。
    • 作者结论与启示:作者认为输出前缀攻击几乎无需额外算力成本却能产生威胁,防御方不能仅过滤用户输入,还必须对客户端提交的助手前缀与推理内容实施校验,且模型服务框架应当限制助手预填功能以防范此类攻击。
    完整解读
已经到底了