跳到正文
10月8日 · 周四

Google DeepMind · 论文

精选论文 16 篇
  1. arXiv:2610.09667 · 65

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    AI 导读东京大学的研究者测试了来自三家开发者的六个闭源推理模型,发现它们在需要随机选择的场景中并非真正随机,而是把标识符转成数值后套用阈值或整除规则。在 1% 人工复核任务中,GPT-6 Sol 的选取率接近目标(1008 条请求中选中 9 条,0.89%),但选中的请求集中在标识符数值低于 1% 的样本上,掌握标识符的发送方可以据此避开审查;Gemini 3.8 Flash 与 Claude Sonnet 5 几乎不选,Luna 选取率 0.40%。在四人参与博弈任务中,共享同一标识符使 GPT-6 Sol 和 Gemini 3.8 Flash 分别有 91% 和 88% 的组出现全体一致,损失升至独立随机基准的 3.5 至 3.8 倍;使用同一毫秒生成的 UUIDv7 时参与率高达 0.95 和 0.93,损失为基准的 6.6 至 6.9 倍。

    深度解读生成中

    论文详情
  2. 评测/基准arXiv:2610.08871 · 63

    CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%

    作者评估 7 款 LLM 智能体,发现所有模型均存在凭据泄露,主恢复率最高仅 24.2%(GPT-5-mini,Table 10)。

    • 31.3%Claude Opus 4.8 在定向设定下的泄露率(Table 3)
    • 1.6%Claude Opus 4.8 在自主设定下的泄露率(Table 3)
    • 88.3%Claude Opus 4.8 在自主设定下的误拒率(Table 3)
    6 问速览评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。
    1. 这篇论文试图解决什么问题?

      评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。

    2. 有哪些相关研究?

      涵盖网页钓鱼检测、智能体安全与隐私评测、以及针对智能体的社会工程攻击研究,本文侧重成对控制与受信恢复能力。

    3. 论文如何解决这个问题?

      构建包含定向、自主和恢复三套件的成对测试沙盒,覆盖 8 种欺骗线索与 4 种框架,通过抓包日志判定凭据泄露与恢复。

    4. 论文做了哪些实验?

      7 款模型在定向与自主设定下均存在泄露,恢复率最高仅 24.2%,谨慎框架大幅压低完成率,域名验证可兼顾安全与效用。

    5. 有什么可以进一步探索的点?

      论文未设专门章节讨论局限;实验在本地沙盒中覆盖 7 款模型、8 类虚构服务以及三大评测套件。

    6. 总结一下论文的主要内容

      提出评测智能体凭据泄露与恢复的 CREDLEAK-BENCH,发现全模型均存在泄露且恢复率仅 0%–24.2%,揭示安全与效用权衡。

    完整解读
  3. 防御arXiv:2609.11757 · 60

    研究者披露 AP2 支付协议的 Whisper 提示注入攻击并提出 A-VIP 防御

    作者对AP2开展Whisper决策攻击与A-VIP防御,事实操纵在gemini-3.1-flash-lite达73.3%。

    • 90%gemini-2.5-flash-lite上Vault Whisper成功率(Table 3)
    • 56%gemini-2.5-flash-lite上Branded Whisper成功率(Table 3)
    • 73.3%gemini-3.1-flash-lite上Selection Whisper成功率(Table 3)
    6 问速览协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。
    1. 这篇论文试图解决什么问题?

      协议层签名能验证交易未篡改,但无法约束做决策的推理过程,导致商户文本可操纵智能体行为。

    2. 有哪些相关研究?

      现有研究涵盖智能体支付安全、提示注入基准及模型输入输出防御,但缺乏意图与决策的协议层绑定。

    3. 论文如何解决这个问题?

      A-VIP将意图视为权能授权,通过会话令牌解耦凭据、结构化比对绑定购物车,并对未授权超支触发确认。

    4. 论文做了哪些实验?

      评测覆盖17个Google模型及跨厂商模型,实测记录到事实操纵普遍有效,A-VIP成功拦截结构篡改。

    5. 有什么可以进一步探索的点?

      作者指出同价替换无法拦截、确认依赖用户审查及扫描器误报等局限,未来可探索多轮社工与密码学证明。

    6. 总结一下论文的主要内容

      论文揭示了AP2协议决策层受操纵的风险,提出结构化与权能绑定防御A-VIP,并发布评测基准。

    完整解读
  4. 攻击arXiv:2601.02670 · 59

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    作者提出无攻击模型的SLIP,在AdvBench上对11个模型取得平均94.7%的ASR且平均仅需7.9次查询。

    • 94.7%AdvBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 94.4%HarmBench 上 11 个模型、SLIP 默认设置下的平均 ASR(Table 1)
    • 7.9AdvBench 上 SLIP 每成功攻击一次的平均 API 查询次数(Table 2)
    6 问速览论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。
    1. 这篇论文试图解决什么问题?

      论文研究对齐大模型能否在无需外部攻击模型的情况下,仅利用自身潜在知识引导多轮对话实现自我越狱。

    2. 有哪些相关研究?

      论文梳理了模型对齐、单轮越狱与多轮越狱工作,重点对比了依赖外部攻击模型的基线及树搜索方法。

    3. 论文如何解决这个问题?

      SLIP 构建安全数据种子池并利用词频与嵌入相似度识别词汇差距,以广度优先搜索驱动模型逐步展开有害回答。

    4. 论文做了哪些实验?

      SLIP 在两项基准上取得约 94% 平均 ASR 且平均仅需 7.9 次查询,现有多轮防御表现出模型间差异。

    5. 有什么可以进一步探索的点?

      作者指出方法仅在英语提示词上验证,防御监控不足以抵御自适应攻击,且表征代理与内部状态可能存在差异。

    6. 总结一下论文的主要内容

      论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。

    完整解读
  5. 评测/基准arXiv:2610.07639 · 58

    HarnessSecurity-Bench 横向评测六款编码智能体框架的安全机制

    在GLM-5.2与6款harness上,开启auto-approve使总体ASR从29.2%升至95.6%。

    • 95.6%GLM-5.2在AA评测中开启auto-approve时的总体ASR(Table 6)
    • 29.2%GLM-5.2在AA评测中关闭auto-approve时的总体ASR(Table 6)
    • 0.8%GLM-5.2在NI评测中开启网络隔离时的总体ASR(Table 6)
    6 问速览代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。
    1. 这篇论文试图解决什么问题?

      代码智能体harness的安全机制实现现状与运行时防护效果缺乏系统评估,论文提出了十机制分类法与基准测试HSB。

    2. 有哪些相关研究?

      既有研究涵盖harness分类、生命周期安全审计与特定载荷注入基准,但缺乏对原生机制ON/OFF状态的双重判定隔离评估。

    3. 论文如何解决这个问题?

      建立十机制分类与五方独立审计矩阵,并通过Docker环境注入五类攻击面,以双重预言机量化ON/OFF状态差异。

    4. 论文做了哪些实验?

      在GLM-5.2下开展2500次试验,发现机制防护效果与效用代价分化明显,部分机制存在解释器绕过路径。

    5. 有什么可以进一步探索的点?

      作者指出基准受限于单模型评测、仿真环境保真度及闭源工具缺失,实验覆盖6款开源harness与23个任务。

    6. 总结一下论文的主要内容

      系统审计40款harness并实证评测9类安全机制,量化了自动审批的暴露风险、强隔离的效用代价以及替代执行路径绕过。

    完整解读
  6. 攻击arXiv:2607.23496 · 55

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    研究者利用内部表征归因发现脆弱场景,使 Llama-3.1-8B 上的 6 种黑盒攻击平均 ASR 提升 18.2 个百分点。

    • 18.2 个百分点Llama-3.1-8B 在 GuidedBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 14.5 个百分点Llama-3.1-8B 在 HarmBench 上注入场景后 6 种黑盒攻击平均 ASR 提升(Table 1)
    • 49.0%GPT-5 目标模型在 PAIR 攻击下注入 Ministral 场景后的 ASR(Table 2)
    6 问速览探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。
    1. 这篇论文试图解决什么问题?

      探究特定场景削弱大模型拒绝的内部表征机制,并提出 Concept2Scenario 框架从内部概念中系统发现脆弱场景与组合。

    2. 有哪些相关研究?

      梳理了越狱攻击与安全机械可解释性研究,指出现有方法缺乏表征空间因果归因且未将内部特征转化为可操作场景。

    3. 论文如何解决这个问题?

      提出 Concept2Scenario,通过 SAE 和 CAV 建立表征干预归因,筛选抑制拒绝的特征并闭环转译为可复用的自然语言场景。

    4. 论文做了哪些实验?

      在 3 个开源和 3 个闭源模型上评测 6 种黑盒攻击,脆弱场景使平均 ASR 最高提升 18.2 个百分点并提升多轮攻击效率。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向;实验事实覆盖了 3 个开源与 3 个闭源模型在两个基准上的黑盒攻击评测。

    6. 总结一下论文的主要内容

      该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    完整解读
  7. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  8. 评测/基准arXiv:2607.20891 · 57

    MisKnow-Agent 评测:单篇误导文档使 Deep Research 错误结论平均采纳率升至 54.7%

    评估发现注入单篇虚假文档使六种开源深度研究配置的平均虚假结论采纳率从对照的 0% 升至 54.7%,合成前暴露达 85.5%。

    • 0%六种开源配置在无注入对照条件下的平均 FCAR(据 Section 4.4)
    • 54.7%六种开源配置在注入 1 篇误导文档时的平均 FCAR(据 Section 4.4)
    • 85.5%六种开源配置在合成前(Pre-synthesis)注入时的平均 FCAR(据 Section 4.2)
    6 问速览论文评估在长程深度研究工作流中,智能体是否会在最终报告中采纳具有表面可信度但实际虚假的误导性知识。
    1. 这篇论文试图解决什么问题?

      论文评估在长程深度研究工作流中,智能体是否会在最终报告中采纳具有表面可信度但实际虚假的误导性知识。

    2. 有哪些相关研究?

      论文梳理了深度研究智能体及其评估、外部知识下的模型可靠性与知识冲突、开放网络虚假信息等相关工作。

    3. 论文如何解决这个问题?

      论文提出了 MisKnow-Agent 受控评估框架,构建经核实的误导知识蓝图与多维可控文档,并设计了前后两阶段防御策略。

    4. 论文做了哪些实验?

      论文在两个开源框架和 Gemini Deep Research 上评估了误导知识对虚假结论采纳率的影响及防御效果。

    5. 有什么可以进一步探索的点?

      论文未专门设立章节讨论局限与后续方向,其实验覆盖了两个开源框架、一个闭源系统及多维受控条件。

    6. 总结一下论文的主要内容

      论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。

    完整解读
  9. 攻击arXiv:2608.23858 · 56

    研究者对 Google AP2 v0.2 做系统安全分析,识别 48 项威胁

    作者系统分析Google智能体支付协议AP2 v0.2,指出合法签名无法防御前置上下文操纵,并识别出8个高风险威胁。

    • 66.7%STRIDE-GPT五架构运行对48个威胁的Full/Partial覆盖率(8.1节)
    • 0.9848位独立专家对25个威胁AIVSS严重度评级的Gwet's AC2估计值(Table 6)
    • 92.5%8位专家在120次评估中重现单评估者AIVSS参考严重度等级的比例(8.2节)
    6 问速览分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。
    1. 这篇论文试图解决什么问题?

      分析智能体支付协议AP2在未签名上下文与多架构下的安全盲区,系统化识别前置操纵威胁。

    2. 有哪些相关研究?

      梳理了AP2初期安全性、多智能体商业协议及支撑协议(MCP与A2A)的安全研究现状。

    3. 论文如何解决这个问题?

      划分生命周期与架构,用MAESTRO和AIVSS系统化建模48个威胁并设计三层扫描器。

    4. 论文做了哪些实验?

      通过8名专家重现AIVSS评分、对比STRIDE-GPT,并在自建测试床上完成5项PoC验证与扫描器消融。

    5. 有什么可以进一步探索的点?

      作者指出评估基于自建测试床且未测底层清算系统,后续需在真实公开部署中检验扫描器。

    6. 总结一下论文的主要内容

      系统剖析AP2协议盲区,建立威胁模型并识别8项高危威胁,通过PoC与扫描器推动前置安全防御。

    完整解读
  10. 分析/可解释性arXiv:2609.25366 · 55

    研究:思维链对答案的约束随模型相对任务难度而变化

    作者通过扰动续写发现CoT承重性随难度上升:Gemma在GSM8K错误传播率3.9%,在BBH达40.9%。

    • 94.5%Gemma-2-9B-IT,GSM8K,旁路率(Table 1)
    • 40.9%Gemma-2-9B-IT,BBH,错误传播率(Table 1)
    • 98.8%Gemma-2-9B-IT,序贯模型已解释离差中难度项占比(Table 5)
    6 问速览探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。
    1. 这篇论文试图解决什么问题?

      探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。

    2. 有哪些相关研究?

      围绕思维链忠实性行为分析、机制可解释性与模型自我修正展开,本文在可扩展的因果扰动与表征分析上确立定位。

    3. 论文如何解决这个问题?

      提出基于续写的因果测试协议,通过单步扰动与截断续写度量思维链承重性,并结合探针与激活引导检验其表征与可控性。

    4. 论文做了哪些实验?

      作者在被测模型和正确多步基线中比较难度、扰动、表征与干预;结果支持承重性与模型相对难度相关,但不构成跨模型的普遍因果规律。

    5. 有什么可以进一步探索的点?

      汇总作者明确提出的模型规模、单步扰动与标签噪声等局限,并客观梳理实验覆盖的边界。

    6. 总结一下论文的主要内容

      在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。

    完整解读
  11. 攻击arXiv:2609.09553 · 55

    研究:任意密文攻击前沿大模型无需微调即可越狱

    作者通过字母置换提示对前沿模型发起攻击,在 Claude Sonnet 4 上无需微调达成 100% ASR(Table II)。

    • 100%Claude Sonnet 4,Single-shot,ASR(Table II)
    • 80%Claude Sonnet 4.5,Iterative,ASR(Table II)
    • 100%Gemini 3 Flash,Iterative,ASR(Table II)
    6 问速览论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。
    1. 这篇论文试图解决什么问题?

      论文研究在黑盒商业大模型对话 API 中,无需微调即利用任意字母置换密码绕过有害性分类器与安全对齐的可行性。

    2. 有哪些相关研究?

      论文梳理了优化类越狱、隐蔽与文本越狱、密码越狱等研究,指出既有密码越狱受限于微调接口或旧模型假设。

    3. 论文如何解决这个问题?

      作者设计了单轮置换与基于示例的递增迭代算法,通过上下文学习引导模型掌握密码,并关闭 reasoning 以绕过对齐。

    4. 论文做了哪些实验?

      测试显示前沿模型在特定密码变体下 ASR 可达 100%,而前代模型 ASR 均为 0%(Table I、II)。

    5. 有什么可以进一步探索的点?

      作者指出了密文拼写错误、回复细节较少、依赖禁用 reasoning 等局限,并提出交互式越狱及防御探索等后续方向。

    6. 总结一下论文的主要内容

      前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    完整解读
  12. 攻击arXiv:2609.38899 · 56

    SceneJail:利用视频场景上下文越狱多模态大模型

    SceneJail通过构造视频情境与搜索提示词越狱Video-MLLM,在HADES上平均ASR达91.47%。

    • 91.47%SceneJail-F在HADES上对8个模型的平均ASR
    • 89.42%SceneJail-S在HADES上对8个模型的平均ASR
    • 78.90%SceneJail-F在SafeBench上8模型平均ASR
    6 问速览视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。
    1. 这篇论文试图解决什么问题?

      视频多模态模型会将画面中的违规查询融入视频情境理解,导致攻击者可通过操纵周围情境与提示词实现黑盒越狱。

    2. 有哪些相关研究?

      论文梳理了多模态模型、多模态越狱与视频越狱三类工作,指出既有研究聚焦查询编码而忽视了周围视频情境的攻击作用。

    3. 论文如何解决这个问题?

      SceneJail通过自适应情境构建动态生成适配视频,并利用情境专用记忆搜索引导提示词,形成嵌套黑盒越狱循环。

    4. 论文做了哪些实验?

      在两项基准与8个模型上,SceneJail的ASR均超过现有基线,且分帧变体展现出对单帧图像过滤的抵御能力。

    5. 有什么可以进一步探索的点?

      作者明确指出了生成搜索开销与合成视频环境两项局限,未来可探索轻量化模型及自然长视频场景。

    6. 总结一下论文的主要内容

      论文揭示了视频情境上下文这一未被充分探索的越狱攻击面,通过自适应构建与搜索实现较高越狱成功率,凸显了原生视频防御需求。

    完整解读
  13. 评测/基准arXiv:2608.03070 · 57

    FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0

    FAR.AI评估前沿模型CBRNE及网安防御,Grok 4.5与Gemini 3.1 Pro现通用越狱,另两模型未破。

    • 63Grok 4.5 随机搜索下通用越狱数(Figure 1)
    • 18Gemini 3.1 Pro 随机搜索通用越狱数(Figure 1)
    • 385Grok 4.5 专家引导下通用越狱数(Figure 1)
    6 问速览前沿AI模型在高危领域的防御水平参差不齐,论文旨在建立基线测试标准并量化通用越狱风险。
    1. 这篇论文试图解决什么问题?

      前沿AI模型在高危领域的防御水平参差不齐,论文旨在建立基线测试标准并量化通用越狱风险。

    2. 有哪些相关研究?

      论文梳理了越狱攻击技术、防御分类器机制以及高危能力评测三类相关工作,定位本文为最低静态防御基准。

    3. 论文如何解决这个问题?

      论文提出了包含67个原语的越狱分类法,构建了双重危害数据集,并通过三阶段漏斗评测识别通用越狱。

    4. 论文做了哪些实验?

      评测覆盖4家厂商旗舰模型,Grok 4.5与Gemini 3.1 Pro暴露大量通用越狱,Claude与GPT均未失陷。

    5. 有什么可以进一步探索的点?

      作者指出了数据集双重用途歧义、评审漏报及静态局限,实验未覆盖动态自适应攻击和真实能力提升。

    6. 总结一下论文的主要内容

      论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。

    完整解读
  14. 攻击arXiv:2609.22510 · 59

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    作者评估了条件触发的爆炸提示词,发现其在 Grok-4.20 上对真实工具执行的攻击成功率达 34.2%,而祈使形式为 0.0%。

    • 34.2%Grok-4.20 在 AgentDojo 上的 EP 工具执行成功率(Table 1)
    • 0.0%Grok-4.20 在 AgentDojo 上的 IPI 工具执行成功率(Table 1)
    • 16.5%7 款基础模型在 AgentDojo 上的 EP 配对均值(Table 1)
    6 问速览爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。
    1. 这篇论文试图解决什么问题?

      爆炸提示词通过条件化表述实现注入与执行的时间分离,绕过防御并在触发时执行工具调用。

    2. 有哪些相关研究?

      论文对比了间接提示注入、智能体攻击、现存检测防御和后门机制,强调时间分离与无持久化特性。

    3. 论文如何解决这个问题?

      论文形式化了爆炸提示词生成空间,揭示条件化绕过机理,并提出了轻量滑动窗口检测器 DeFuse。

    4. 论文做了哪些实验?

      实验覆盖 7 款基础模型、4 类防御与 9 个生产智能体,证实爆炸提示词显著提高绕过率且可在摄入期检出。

    5. 有什么可以进一步探索的点?

      作者指出自适应改写、长会话存活等局限,实际评测覆盖 7 款基础模型与 9 款生产工具。

    6. 总结一下论文的主要内容

      论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    完整解读
  15. 攻击arXiv:2609.29775 · 56

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    评估显示单独注入推理几乎无效(ASR≈0%),但搭配前缀可将 Gemini 3 Flash Preview 的 ASR 升至 99%(Table 3)。

    • 99%Gemini 3 Flash Preview 推理+静态前缀 ASR(Table 3)
    • 0%DeepSeek V4 Flash 仅注入推理 ASR(Table 3)
    • 76%DeepSeek V4 Flash 推理+上下文前缀 ASR(Table 3)
    6 问速览研究探究输出前缀攻击与草稿推理通道注入对推理大模型安全对齐的有效性及防御机制。
    1. 这篇论文试图解决什么问题?

      研究探究输出前缀攻击与草稿推理通道注入对推理大模型安全对齐的有效性及防御机制。

    2. 有哪些相关研究?

      论文梳理了非推理模型的输出前缀攻击、推理带来的安全漏洞、对话与推理注入及前缀感知防御等研究。

    3. 论文如何解决这个问题?

      论文提出 3×2 析因攻击方案,结合针对性草稿推理生成与 API 前缀注入,系统评估推理通道的脆弱性。

    4. 论文做了哪些实验?

      实验覆盖 3 款模型与 1800 个测试样例,发现纯推理注入无效,但结合前缀后 ASR 最高可升至 99%。

    5. 有什么可以进一步探索的点?

      论文指出研究仅探索三款模型与单一数据集且裁判验证较少,未来计划扩展基准并研究注意力机制。

    6. 总结一下论文的主要内容

      论文针对推理大模型评估输出前缀与草稿推理注入,发现二者协同可推高 ASR,同时指出安全防护能够在系统层面解决该漏洞。

    完整解读
  16. 分析/可解释性arXiv:2609.32717 · 57

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    研究者测试语义保留变换,发现模型效用保留时对齐失效大幅上升,如微调 GPT-4.1 mini 的 ASR 达 74.3%。

    • 74.3%GPT-4.1 mini 在 AdvBench 上的变换后 ASR(微调)
    • 43.0%Gemini 3 Flash 在 AdvBench 上的变换后 ASR(ICL)
    • 40.3%Llama3-8B 在 AdvBench 上的变换后 ASR(ρ=0 微调)
    6 问速览研究大语言模型在语义保留变换引起的输入分布偏移下,其安全对齐是否能够像任务效用一样稳健泛化。
    1. 这篇论文试图解决什么问题?

      研究大语言模型在语义保留变换引起的输入分布偏移下,其安全对齐是否能够像任务效用一样稳健泛化。

    2. 有哪些相关研究?

      涵盖浅层对齐表征机制、基于编码与提示词的越狱攻击以及少量样本微调越狱等相关研究。

    3. 论文如何解决这个问题?

      构建规则可逆的合成变换作为受控探针,通过微调与上下文学习促使模型适应,并配对评估效用与对齐。

    4. 论文做了哪些实验?

      在八款模型上测试效用与安全,发现普遍存在对齐失效上升幅度远大于效用降幅的非对称现象。

    5. 有什么可以进一步探索的点?

      作者指出的局限包括变换限于字符级编码、内部表征机制尚未完全厘清以及未提出专用防御方案等。

    6. 总结一下论文的主要内容

      论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。

    完整解读
已经到底了