跳到正文
10月8日 · 周四

Google DeepMind · 论文

精选论文 15 篇
  1. 攻击arXiv:2601.02670 · 59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。

    • 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
    6 问速览论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
    1. 这篇论文试图解决什么问题?

      论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。

    2. 有哪些相关研究?

      论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。

    3. 论文如何解决这个问题?

      SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。

    4. 论文做了哪些实验?

      SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。

    5. 有什么可以进一步探索的点?

      作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。

    6. 总结一下论文的主要内容

      论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。

    完整解读
  2. 攻击arXiv:2607.23496 · 55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。

    • 18.2 个百分点Llama-3.1-8B 在 GuidedBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 14.5 个百分点Llama-3.1-8B 在 HarmBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 49.0%GPT-5 目标模型在 PAIR 攻击下注入 Ministral 场景后的 ASR(Table 2)
    6 问速览探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
    1. 这篇论文试图解决什么问题?

      探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。

    2. 有哪些相关研究?

      梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。

    3. 论文如何解决这个问题?

      提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。

    4. 论文做了哪些实验?

      在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。

    6. 总结一下论文的主要内容

      该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    完整解读
  3. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  4. 攻击arXiv:2608.23858 · 56

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

    • 66.7%STRIDE-GPT五架构运行对48个威胁的Full/Partial覆盖率(8.1节)
    • 0.9848位独立专家对25个威胁AIVSS严重度评级的Gwet's AC2估计值(Table 6)
    • 92.5%8位专家在120次评估中重现单评估者AIVSS参考严重度等级的比例(8.2节)
    6 问速览分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。
    1. 这篇论文试图解决什么问题?

      分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    2. 有哪些相关研究?

      梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    3. 论文如何解决这个问题?

      划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    4. 论文做了哪些实验?

      通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    5. 有什么可以进一步探索的点?

      作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    6. 总结一下论文的主要内容

      系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    完整解读
  5. 攻击arXiv:2609.09553 · 55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    作者通过字母置换提示对前沿模型发起攻击,在 Claude Sonnet 4 上无需微调达成 100% ASR(Table II)。

    • 100%Claude Sonnet 4,Single-shot,ASR(Table II)
    • 80%Claude Sonnet 4.5,Iterative,ASR(Table II)
    • 100%Gemini 3 Flash,Iterative,ASR(Table II)
    6 问速览论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。
    1. 这篇论文试图解决什么问题?

      论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。

    2. 有哪些相关研究?

      论文梳理了优化类越狱、隐蔽与文本越狱、密码越狱等研究,指出既有密码越狱受限于微调接口或旧模型假设。

    3. 论文如何解决这个问题?

      作者设计了单轮置换与基于示例的递增迭代算法,通过上下文学习引导模型掌握密码,并关闭 reasoning 以绕过对齐。

    4. 论文做了哪些实验?

      测试显示前沿模型在特定密码变体下 ASR 可达 100%,而前代模型 ASR 均为 0%(Table I、II)。

    5. 有什么可以进一步探索的点?

      作者指出了密文拼写错误、回复细节较少、依赖禁用 reasoning 等局限,并提出交互式越狱及防御探索等后续方向。

    6. 总结一下论文的主要内容

      前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  6. 攻击arXiv:2609.38899 · 56

    SceneJail:利用视频场景上下文越狱多模态大模型

    SceneJail通过构造视频情境与搜索提示词越狱Video-MLLM,在HADES上平均ASR达91.47%。

    • 91.47%SceneJail-F在HADES上对8个模型的平均ASR
    • 89.42%SceneJail-S在HADES上对8个模型的平均ASR
    • 78.90%SceneJail-F在SafeBench上8模型平均ASR
    6 问速览视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。
    1. 这篇论文试图解决什么问题?

      视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。

    2. 有哪些相关研究?

      论文梳理了多模态模型、多模态越狱与视频越狱三类工作,指出既有研究聚焦查询编码而忽视了周围视频情境的攻击作用。

    3. 论文如何解决这个问题?

      SceneJail通过自适应情境构建动态生成适配视频,并利用情境专用记忆搜索引导提示词,形成嵌套黑盒越狱循环。

    4. 论文做了哪些实验?

      在两项基准与8个模型上,SceneJail的ASR均超过现有基线,且分帧变体展现出对单帧图像过滤的抵御能力。

    5. 有什么可以进一步探索的点?

      作者明确指出了生成搜索开销与合成视频环境两项局限,未来可探索轻量化模型及自然长视频场景。

    6. 总结一下论文的主要内容

      论文揭示了视频情境上下文这一未被充分探索的越狱攻击面,通过自适应构建与搜索实现较高越狱成功率,凸显了原生视频防御需求。

    完整解读
  7. 攻击arXiv:2609.22510 · 59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    作者评估了条件触发的爆炸提示词,发现其在 Grok-4.20 上对真实工具执行的攻击成功率达 34.2%,而祈使形式为 0.0%。

    • 34.2%Grok-4.20 在 AgentDojo 上的 EP 工具执行成功率(Table 1)
    • 0.0%Grok-4.20 在 AgentDojo 上的 IPI 工具执行成功率(Table 1)
    • 16.5%7 款基础模型在 AgentDojo 上的 EP 配对均值(Table 1)
    6 问速览爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。
    1. 这篇论文试图解决什么问题?

      爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。

    2. 有哪些相关研究?

      论文对比了间接提示注入、智能体攻击、现存检测防御和后门机制,强调时间分离与无持久化特性。

    3. 论文如何解决这个问题?

      论文形式化了爆炸提示词生成空间,揭示条件化绕过机理,并提出了轻量滑动窗口检测器 DeFuse。

    4. 论文做了哪些实验?

      实验覆盖 7 款基础模型、4 类防御与 9 个生产智能体,证实爆炸提示词显著提高绕过率且可在摄入期检出。

    5. 有什么可以进一步探索的点?

      作者指出自适应改写、长会话存活等局限,实际评测覆盖 7 款基础模型与 9 款生产工具。

    6. 总结一下论文的主要内容

      论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    完整解读
  8. 攻击arXiv:2609.29775 · 56

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    评估显示单独注入推理几乎无效(ASR≈0%),但搭配前缀可将 Gemini 3 Flash Preview 的 ASR 升至 99%(Table 3)。

    • 99%Gemini 3 Flash Preview 推理+静态前缀 ASR(Table 3)
    • 0%DeepSeek V4 Flash 仅注入推理 ASR(Table 3)
    • 76%DeepSeek V4 Flash 推理+上下文前缀 ASR(Table 3)
    6 问速览研究探究输出前缀攻击与草稿推理通道注入对推理大模型安全对齐的有效性及防御机制。
    1. 这篇论文试图解决什么问题?

      研究探究输出前缀攻击与草稿推理通道注入对推理大模型安全对齐的有效性及防御机制。

    2. 有哪些相关研究?

      论文梳理了非推理模型的输出前缀攻击、推理带来的安全漏洞、对话与推理注入及前缀感知防御等研究。

    3. 论文如何解决这个问题?

      论文提出 3×2 析因攻击方案,结合针对性草稿推理生成与 API 前缀注入,系统评估推理通道的脆弱性。

    4. 论文做了哪些实验?

      实验覆盖 3 款模型与 1800 个测试样例,发现纯推理注入无效,但结合前缀后 ASR 最高可升至 99%。

    5. 有什么可以进一步探索的点?

      论文指出研究仅探索三款模型与单一数据集且裁判验证较少,未来计划扩展基准并研究注意力机制。

    6. 总结一下论文的主要内容

      论文针对推理大模型评估输出前缀与草稿推理注入,发现二者协同可推高 ASR,同时指出安全防护能够在系统层面解决该漏洞。

    完整解读
已经到底了