跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 5 篇
  1. 攻击arXiv:2601.02670 ·

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    提出无外部攻击模型的多轮自我越狱方法SLIP

    测试
    GPT-5.1、GPT-4o、Claude-Sonnet-4.5 等 11 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
    • 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
    • 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
    • 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
    • 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
    • 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
    • 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。
    完整解读
  2. 攻击arXiv:2607.23496 ·

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
    • 研究定位:该论文提出了基于表征因果归因的脆弱场景发现框架 Concept2Scenario,旨在从机械可解释性视角揭示场景包装削弱大模型拒绝的内部机制,并将其转化为可复用的自然语言攻击先验。
    • 问题与机理核心:针对现有红队主要依赖经验和试错、缺乏内部因果解释的问题,论文发现模型内部存在能够因果抑制拒绝方向的潜在场景表征,证实场景包装通过激活特定概念来降低拒绝倾向。
    • 方法设计要点:在开源模型中间层残差流训练稀疏自编码器(SAE)提取解耦概念,在末层利用线性探针(CAV)量化拒绝分数;在 5,000 条有害请求上沿概念解码方向实施标准化干预以筛选强抑制特征,通过分析大模型实现概念解读与“概念 → 场景 → 概念”闭环验证,并利用交互归因挖掘协同场景组合。
    • 核心实验结果:在 GuidedBench 基准上,将挖掘出的场景注入 6 种黑盒攻击后,Llama-3.1-8B 的全攻击平均 ASR 提升了 18.2 个百分点(从 33.3%–94.5% 提升至 84.5%–98.3%);在 HarmBench 上平均提升 14.5 个百分点;在智能体评测 AgentHarm 上,场景引导重写使 Qwen3.5-9B 的任务完成度提升 7.1 个百分点。
    • 跨模型迁移与多轮加速:仅由开源模型挖掘的场景可直接迁移至商业黑盒模型,使 GPT-5 在 PAIR 攻击下的 ASR 达到 49.0%(较基线提升 27.5 个百分点);交互归因筛选的协同组合使 Llama-3.1-8B 上 PAIR 的首轮攻击成功率从单场景的 53.0% 提升至 81.0%。
    • 作者结论与启示:作者认为大模型的内部表征已编码了其自身的脆弱场景,且部分场景漏洞在不同模型家族间具备通用性;基于表征空间的归因分析能够为自动化红队评估与针对性安全防御提供可解释的先验支撑。
    完整解读
  3. 攻击arXiv:2609.09553 ·

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    测试
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个提示层
    场景
    模型与 API攻击者黑盒
    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
    • 研究定位:该研究展示了一种针对黑盒商业大模型的新型攻击向量,表明此前依赖微调接口的任意密码越狱已能直接通过常规对话接口实现。
    • 核心问题:现有防御依赖默认放行的有害性分类器,且既有研究认为未见密码无法直接在聊天中生效;作者试图验证前沿模型能否仅凭提示词掌握任意字母置换并突破安全对齐。
    • 方法设计:攻击通过提示词静态输入置换规则与加密问答对,利用上下文学习使模型掌握字符映射;方法包括全量单轮置换与基于词频递增的迭代算法,并在调用时关闭模型 reasoning 以防止其显式解密。
    • 关键实验发现:在 5 次采样评估中,Claude Sonnet 4 单轮攻击达到 100% ASR(7+ 置换);Gemini 3 Flash 迭代算法达到 100% ASR(10+ 置换);GPT 5.5 结合 crescendo 越狱达到 100% ASR;Claude Sonnet 4.5 定制置换下达到 80% ASR;而 GPT-4 等前代模型 ASR 均为 0%(Table I、II)。
    • 作者结论与启示:作者认为前沿模型能力的提升使得此前不可行的分布外通信成为现实,从而打开了新型攻击面;当前对齐在足够困难的通信任务下容易被旁路,强制启用 reasoning 或部署专门的隐蔽通信检测分类器是潜在的缓解途径(Section VII)。
    完整解读
  4. 攻击arXiv:2609.38899 ·

    SceneJail:利用视频场景上下文越狱多模态大模型

    提出SceneJail,利用视频情境上下文越狱视频多模态模型

    测试
    Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct、Qwen3-VL-8B-Instruct 等 8 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了视频情境上下文这一未被充分探索的越狱攻击面,通过自适应构建与搜索实现较高越狱成功率,凸显了原生视频防御需求。
    • 研究定位:论文针对 Video-MLLM 的安全对齐脆弱性,首次系统性研究了视频情境上下文作为越狱攻击面的可行性。
    • 核心问题:现有视频越狱主要将视频作为承载文本的载体,忽略了周围视频情境对模型判断的影响;实验发现同一有害查询在不同视频情境下会触发不同的安全响应。
    • 方法设计:提出自适应黑盒越狱框架 SceneJail,在不改变原始恶意查询的前提下,通过自适应情境构建动态匹配并生成适配视频情境,并通过情境感知提示词搜索机制在黑盒反馈下优化文本引导。
    • 核心实验结果:在 HADES 基准上,SceneJail-F 与 SceneJail-S 在 8 个目标模型上的平均 ASR 分别达 91.47% 与 89.42%,超过最强基线 SPTV(62.38%);在 SafeBench 上平均 ASR 达 78.90% 与 76.63%,超过最强基线 MCV(43.95%);在图像过滤防御下,分帧变体 SceneJail-S 仍保持 72.25% 的平均 ASR。
    • 作者结论与启示:作者指出,视频模型的安全评估必须将视觉情境、文本内容及时序展示综合考量,现有针对单帧图像的防护手段无法有效抵御情境化与时序分散的多模态攻击,亟需开发针对视频特性的原生安全防护机制。
    完整解读
  5. 攻击arXiv:2609.29775 ·

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    提出推理通道预填与输出前缀组合攻击以越狱推理模型

    测试
    Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5提示层
    场景
    模型与 API攻击者黑盒
    摘要论文针对推理大模型评估输出前缀与草稿推理注入,发现二者协同可推高 ASR,同时指出安全防护能够在系统层面解决该漏洞。
    • 研究定位:作者称本研究是首个针对大模型草稿推理通道系统开展的受控输出前缀攻击实验,评估了暴露推理与隐藏推理两种框架下的安全对齐表现。
    • 解决的问题:随着推理大模型成为主流,部分 API 暴露了可由用户写入的草稿推理字段,研究旨在探明前缀注入攻击在推理模型上的有效性,以及中间推理究竟充当了安全缓冲还是引入了新的攻击面。
    • 方法核心要点:研究采用 3×2 析因设计,对比无前缀、静态顺从前缀与针对性上下文前缀,以及注入与不注入由开源无审查模型生成的恶意推理草稿;对隐藏推理模型则在输出前缀中伪造思考标签进行测试。
    • 关键实验结果:在 AdvBench 的 100 个提示词测试中,单独注入恶意推理在三款模型上均接近无效(ASR 均为 0% 或 1%);但当恶意推理与输出前缀结合时,Gemini 3 Flash Preview 的 ASR 升至 99%(策略 5),DeepSeek V4 Flash 的 ASR 升至 76%(策略 6,Table 3)。
    • 模型与框架防御差异:不同模型对前缀与推理注入的易感性差异明显,采用 Constitutional AI 对齐的 Claude Haiku 4.5 在全部 6 种策略下的 ASR 均不超过 1%(Table 3),体现出该漏洞在工程实践中具备可防御性。
    • 作者结论与启示:作者认为输出前缀攻击几乎无需额外算力成本却能产生威胁,防御方不能仅过滤用户输入,还必须对客户端提交的助手前缀与推理内容实施校验,且模型服务框架应当限制助手预填功能以防范此类攻击。
    完整解读
已经到底了