跳到正文
10月8日 · 周四

红队 · 论文

找到 10 篇
  1. 攻击arXiv:2601.02670 ·

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    提出无外部攻击模型的多轮自我越狱方法SLIP

    测试
    GPT-5.1、GPT-4o、Claude-Sonnet-4.5 等 11 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
    • 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
    • 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
    • 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
    • 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
    • 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
    • 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。
    完整解读
  2. 攻击arXiv:2607.23496 ·

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
    • 研究定位:该论文提出了基于表征因果归因的脆弱场景发现框架 Concept2Scenario,旨在从机械可解释性视角揭示场景包装削弱大模型拒绝的内部机制,并将其转化为可复用的自然语言攻击先验。
    • 问题与机理核心:针对现有红队主要依赖经验和试错、缺乏内部因果解释的问题,论文发现模型内部存在能够因果抑制拒绝方向的潜在场景表征,证实场景包装通过激活特定概念来降低拒绝倾向。
    • 方法设计要点:在开源模型中间层残差流训练稀疏自编码器(SAE)提取解耦概念,在末层利用线性探针(CAV)量化拒绝分数;在 5,000 条有害请求上沿概念解码方向实施标准化干预以筛选强抑制特征,通过分析大模型实现概念解读与“概念 → 场景 → 概念”闭环验证,并利用交互归因挖掘协同场景组合。
    • 核心实验结果:在 GuidedBench 基准上,将挖掘出的场景注入 6 种黑盒攻击后,Llama-3.1-8B 的全攻击平均 ASR 提升了 18.2 个百分点(从 33.3%–94.5% 提升至 84.5%–98.3%);在 HarmBench 上平均提升 14.5 个百分点;在智能体评测 AgentHarm 上,场景引导重写使 Qwen3.5-9B 的任务完成度提升 7.1 个百分点。
    • 跨模型迁移与多轮加速:仅由开源模型挖掘的场景可直接迁移至商业黑盒模型,使 GPT-5 在 PAIR 攻击下的 ASR 达到 49.0%(较基线提升 27.5 个百分点);交互归因筛选的协同组合使 Llama-3.1-8B 上 PAIR 的首轮攻击成功率从单场景的 53.0% 提升至 81.0%。
    • 作者结论与启示:作者认为大模型的内部表征已编码了其自身的脆弱场景,且部分场景漏洞在不同模型家族间具备通用性;基于表征空间的归因分析能够为自动化红队评估与针对性安全防御提供可解释的先验支撑。
    完整解读
  3. 攻击arXiv:2510.11570 ·

    研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏

    提出四种阶段转换攻击,绕过推理模型的安全推理护栏

    测试
    gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个提示层
    场景
    模型与 API攻击者白盒黑盒
    摘要论文系统分析大推理模型阶段转换脆弱性,提出四种红队方法并在多种模型上取得高攻击成功率,呼吁强化基础对齐。
    • 研究定位:针对大推理模型(LRM)依赖显式思维链安全护栏的现状,系统评估其阶段转换逻辑的安全性(Section 1)。
    • 核心问题:探究当前在直接提问下实现高拒答率的推理安全护栏,是否因僵化的“先推理后回答”格式而存在被轻易绕过或恶意操纵的结构性漏洞(Section 1、Section 2)。
    • 方法设计:提出对应推理流水线不同阶段的四种方法:EST伪造转换标记跳过推理,CO通过梯度优化无模板对抗后缀,FoR利用过度拒答模式伪装语义,RH将恶意行动步骤注入推理链(Section 4)。
    • 主要实验结果:
      • 在gpt-oss-120b上,FoR与RH在AdvBench上分别取得96.25%与95.33%的ASR,在CatQA上分别取得95.31%与94.00%的ASR(Table 1)。
      • CO在gpt-oss-20b的5个基准上取得66.75%至74.87%的ASR,且后缀不含模板标记(Table 2)。
      • 在专用防御模型TARS与SafeChain上,RH分别实现95.00%与98.00%的ASR(Table 5)。
      • 在闭源模型GPT-5.4-nano与GPT-5上,RH分别取得65%与47%的ASR(Table 10)。
      • 机理分析显示重放自生成推理在转换点的KL散度为0,且早期层激活修补在50/50样本上反转了输出(Appendix D.5)。
    • 作者结论与启示:作者认为仅依靠推理阶段护栏会带来虚假的安全感,一旦转换逻辑被突破,最终回答阶段的残留防御较为薄弱;作者呼吁推理护栏必须配合防篡改转换机制以及更强的主模型内部对齐(Section 5.4、Section 6)。
    完整解读
  4. 攻击arXiv:2609.08236 ·

    研究:内容不变的风格包装可翻转 LLM 安全评判器的判定

    提出内容不变样式包装,翻转安全评审器的判定

    测试
    Keyword (rulebased)、GPT-4o-mini (gpt4o)、GPT-4o-mini (strongreject) 等 12 个提示层
    场景
    模型与 API攻击者无盒黑盒
    摘要论文揭示特定安全评审器易受保持内容不变的外层包装诱导改变判定,并指出安全评估应将判定稳定性作为重要考量指标。

    这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。

    • 核心定位与研究问题:论文探究以 Llama Guard 和大模型打分提示词为代表的自动安全裁判,在回复的操作性主体内容完全保持不变的情况下,是否会仅因外层语气或框架修饰而改变安全与否的判定。
    • 方法设计:研究者设计了 9 种在字节级别保持回复内容不变的样式包装器(包含 6 种隐匿危害与 3 种虚构危害包装,并划分为纯语气层与增添断言层),在来自 JailbreakBench 的 600 条多模型回复上对 8 种评审器展开评测,建立包含噪声底线测定与 Holm 配对校正的评估流程。
    • 大模型评审器的盲点:在通用提示词下,GPT-4o-mini 对带有先声明拒绝再遵从框架(refusal-then-comply)的有害回复产生了 19.9% 的翻转率(95% CI [15.0, 24.0],Holm p < 10^-4),而其在原始回复上的噪声底线仅为 0.5%;三判两胜重测下该翻转率仍保持在 18.2%。
    • 部署型审查模型的差异表现:部署型审查模型 Llama Guard 4 对教育场景框架(educational framing)产生了 12.3% 的有害漏报翻转(Holm p < 0.05),对 token 拒绝包装产生了 8.3% 的翻转;而专用推理安全分类器 gpt-oss-safeguard-20b 在全部包装下的翻转率均不超过 1.2%,处于其自身 1.5% 噪声底线之内。
    • 提示词改进的防御效果:在相同模型 GPT-4o-mini 上,采用明确要求忽略外层语气的 StrongREJECT 风格提示词后,token 拒绝包装的翻转率从 19.9% 降至 1.7%,降幅约为十倍。
    • 作者结论与建议:作者认为安全评审器的脆弱性并非普遍均匀分布,而是呈现模型特异性盲点;作者建议安全基准与防御评估在报告安全得分的同时,应报告面对内容不变修饰时的翻转预算(flip budget),并在采用评审器前对其样式不变性进行先期审计。
    完整解读
  5. 攻击arXiv:2607.18056 ·

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个提示层
    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
    • 研究定位:这是一项针对前沿大语言模型双用途生物安全风险的红队评测与转化验证研究。
    • 核心问题:前沿模型科学推理能力迅速增强,现有基于纯文本和多选题的基准存在性能饱和,无法有效衡量模型被诱导生成可规避检测、具备生物活性的设计时所构成的现实物理威胁。
    • 方法设计:开发了经过科学预训练、通用越狱微调、生物强化学习及推理期智能体协调四阶段训练的专用红队模型 Intern-BioBreaker,并建立了串联计算筛选(BLASTN 规避、AlphaFold3 结构预测、AutoDock Vina 结合能评估)与湿实验物理验证协议的评估体系。
    • 主要发现:在 SafeSci-Bio 基准上,Intern-BioBreaker 攻击 GPT-5.5 取得 60.0% ASR,攻击 Claude Opus 4.8 取得 26.0% ASR,14 个模型中有 3 个达到 100% ASR(Figure 3);在 SoSBench-Bio 上,10 个模型达到 100% ASR,GPT-5.5 达 99.5%,Claude Opus 4.8 达 59.5%(Figure 4);在流感 HA 蛋白案例中,GPT-5.5 生成的突变序列结合能较原始序列更低(Figure 5、Figure 6);在合成规避测试中,GPT-5.5 与 Gemini 3.1 Pro Preview 实现 100% 序列保真度且 BLAST E-value > 1e-5。
    • 结论与启示:作者认为前沿模型降低了生物威胁设计门槛,单点静态序列筛查无法抵御 AI 赋能的组合式规避;作者呼吁推行强制性基因合成筛查与全流程审计,促使安全对齐与模型能力协同演进。
    完整解读
  6. 攻击arXiv:2608.16465 ·

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    提出JailbreakSkill,用可演化技能自动搜索并复用越狱提示

    测试
    GLM 5.2、DeepSeek-V4-Pro Preview、Llama-3.3-70B-Instruct 等 8 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出以可复用与持续演化技能为核心的红队框架,提升了预算受限下的攻击成功率并积累了可跨模型迁移的越狱规程。
    • 核心定位:论文提出了 JailbreakSkill,这是一个将自动化红队攻击方法表示为可复用且持续演化的智能体技能的黑盒越狱框架。
    • 解决的问题:传统红队方法往往将改写逻辑与具体工作流或提示词深度绑定,无法独立调用与修改,且历史攻击失败的经验难以转化为可复用的独立攻击能力。
    • 方法设计:将攻击能力划分为改写、失败分析与演化三类标准化技能;Stage 1 利用基于风险类别的 UCB 算法在有限查询预算内自适应调用初始技能并早停;Stage 2 聚合未解决的失败轨迹,通过失败分析技能诊断模式,驱动细化、组合或发现生成新技能,并经残差池验证后入库。
    • 关键定量结果:在 AdvBench 和 HarmBench 上,Stage 1 UCB 调度取得 72.0% 与 68.1% 的宏平均 ASR@10,平均查询次数为 4.14 与 4.63 次(Table 1, Table 2);Stage 2 演化使五类模型的宏平均 ASR 提升至 74.2% 与 67.9%,其中对 GPT-5.4 在 AdvBench 上的 ASR@30 提升至 62.5%(Table 3);演化出的部分技能在未见模型 DeepSeek-V4-Pro 上取得 40.6% 的平均 ASR(Table 4)。
    • 作者结论与启示:作者认为自动化红队应当从重复搜索孤立的对抗提示词,转向维护和积累可跨任务与跨模型复用的模块化攻击技能库。
    完整解读
  7. 攻击arXiv:2609.39902 ·

    CodeMimicry:利用代码域安全泛化滞后实现结构化代码补全越狱

    提出CodeMimicry,以结构化代码补全诱导模型生成有害内容

    测试
    GPT-4o、GPT-4.1、GPT-5-chat 等 10 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文针对代码域安全泛化滞后提出黑盒攻击CodeMimicry,取得高ASR并开展表征机制分析与防御评估。

    论文研究了大语言模型在代码领域存在的安全泛化滞后现象,提出了一种基于面向对象代码补全的黑盒越狱框架CodeMimicry。

    核心问题在于,主流大模型的安全对齐大多在自然语言语料上训练,未能有效覆盖结构化的代码生成子空间,导致模型面临代码补全请求时出现安全防线薄弱。

    方法设计上,CodeMimicry利用具备代码能力的攻击模型,将恶意目标转化为面向对象类中的核心方法名与注释说明,构造未完成代码,并添加模拟合法用户代码补全的工程包装;结合大模型评估器的打分结果,通过对话历史驱动攻击模型多轮自修正。

    实验结果方面,在8个商用模型上,CodeMimicry在AdvBench和HarmBench上分别取得96.25%和96.07%的平均ASR,平均查询次数分别为1.51和1.46;在Claude Sonnet 4上取得90.00%的ASR;生成的代码在语法和执行层面达到97.1%的功能有效率;潜空间机制分析显示成功攻击表征避开了模型的拒绝激活方向。

    作者认为,现有安全对齐在代码等结构化任务上留下了薄弱盲区,单纯增强推理能力不足以抵御此类攻击,需要开发针对代码补全子空间的专门安全对齐与防御方案。

    完整解读
  8. 攻击arXiv:2609.38253 ·

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出CollageAttack,用空间文本碎片重组越狱文生图模型

    测试
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个提示层
    场景
    模型与 API攻击者黑盒
    摘要系统揭示T2I跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
    1. 研究定位与核心问题:针对文本到图像(T2I)生成模型中的跨模态对齐缺陷,研究攻击者如何利用模型在二维图像中组织场景与渲染文本的视觉合成能力,使在串行提示词中隐蔽的不完整碎片在生成图像中重构为显性有害语义。
    2. 方法框架:提出的 CollageAttack 属于黑盒自动化单提示词越狱框架,由大语言模型依据模板一次性生成三个协同指令:构建与意图相关的场景背景、分配3至5个符合环境的空白承载表面(如海报、横幅)、以及将有害文本切分为3至4个短语碎片并指定具体排版与空间位置。
    3. 攻击成功率表现:在包含5个主流商业与开源模型的200条DGHS仇恨样本评测中,CollageAttack 聚合 ASR 达到 77.0%,高出对比基线 SneakyPrompt(47.5%);在 Doubao-Seedream-5.0-Lite 上 ASR 达 86.0%(高出该模型最强基线 18.5 个百分点),在 gpt-image-2 上达到 57.5%(Table 1)。
    4. 图像有害性与传播冲击力:生成的图像在 GPT-4.1 裁判下的跨模型平均有害性评分达 6.12/10(基线最高为 4.23/10);在全部5个模型上均有超半数样本的视觉传播冲击力被评为强于源文本,其中 FLUX.2 Dev 上的放大比例达 69.4%(Table 2)。
    5. 跨模态语义重构:多评估器 CLIP 余弦相似度测试显示,分散碎片在图像中能够保持源意图对齐(在 Google 评估器下达 8.14,高出 SneakyPrompt 的 6.88,Figure 3);组件消融表明三个模块协同使用时有害性评分最高(6.41,Table 3)。
    6. 作者结论与启示:作者指出,T2I模型的安全风险不仅来源于连续文本提示词,更能从分散元素的多模态空间合成中涌现;现有的串行提示词过滤无法有效抵御此类空间跨模态组合攻击,亟需开发兼顾图像二维视觉语义的防御机制。
    完整解读
  9. 攻击arXiv:2609.38899 ·

    SceneJail:利用视频场景上下文越狱多模态大模型

    提出SceneJail,利用视频情境上下文越狱视频多模态模型

    测试
    Qwen2.5-VL-7B-Instruct、Qwen2.5-VL-32B-Instruct、Qwen3-VL-8B-Instruct 等 8 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文揭示了视频情境上下文这一未被充分探索的越狱攻击面,通过自适应构建与搜索实现较高越狱成功率,凸显了原生视频防御需求。
    • 研究定位:论文针对 Video-MLLM 的安全对齐脆弱性,首次系统性研究了视频情境上下文作为越狱攻击面的可行性。
    • 核心问题:现有视频越狱主要将视频作为承载文本的载体,忽略了周围视频情境对模型判断的影响;实验发现同一有害查询在不同视频情境下会触发不同的安全响应。
    • 方法设计:提出自适应黑盒越狱框架 SceneJail,在不改变原始恶意查询的前提下,通过自适应情境构建动态匹配并生成适配视频情境,并通过情境感知提示词搜索机制在黑盒反馈下优化文本引导。
    • 核心实验结果:在 HADES 基准上,SceneJail-F 与 SceneJail-S 在 8 个目标模型上的平均 ASR 分别达 91.47% 与 89.42%,超过最强基线 SPTV(62.38%);在 SafeBench 上平均 ASR 达 78.90% 与 76.63%,超过最强基线 MCV(43.95%);在图像过滤防御下,分帧变体 SceneJail-S 仍保持 72.25% 的平均 ASR。
    • 作者结论与启示:作者指出,视频模型的安全评估必须将视觉情境、文本内容及时序展示综合考量,现有针对单帧图像的防护手段无法有效抵御情境化与时序分散的多模态攻击,亟需开发针对视频特性的原生安全防护机制。
    完整解读
  10. 攻击arXiv:2609.29775 ·

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    提出推理通道预填与输出前缀组合攻击以越狱推理模型

    测试
    Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5提示层
    场景
    模型与 API攻击者黑盒
    摘要论文针对推理大模型评估输出前缀与草稿推理注入,发现二者协同可推高 ASR,同时指出安全防护能够在系统层面解决该漏洞。
    • 研究定位:作者称本研究是首个针对大模型草稿推理通道系统开展的受控输出前缀攻击实验,评估了暴露推理与隐藏推理两种框架下的安全对齐表现。
    • 解决的问题:随着推理大模型成为主流,部分 API 暴露了可由用户写入的草稿推理字段,研究旨在探明前缀注入攻击在推理模型上的有效性,以及中间推理究竟充当了安全缓冲还是引入了新的攻击面。
    • 方法核心要点:研究采用 3×2 析因设计,对比无前缀、静态顺从前缀与针对性上下文前缀,以及注入与不注入由开源无审查模型生成的恶意推理草稿;对隐藏推理模型则在输出前缀中伪造思考标签进行测试。
    • 关键实验结果:在 AdvBench 的 100 个提示词测试中,单独注入恶意推理在三款模型上均接近无效(ASR 均为 0% 或 1%);但当恶意推理与输出前缀结合时,Gemini 3 Flash Preview 的 ASR 升至 99%(策略 5),DeepSeek V4 Flash 的 ASR 升至 76%(策略 6,Table 3)。
    • 模型与框架防御差异:不同模型对前缀与推理注入的易感性差异明显,采用 Constitutional AI 对齐的 Claude Haiku 4.5 在全部 6 种策略下的 ASR 均不超过 1%(Table 3),体现出该漏洞在工程实践中具备可防御性。
    • 作者结论与启示:作者认为输出前缀攻击几乎无需额外算力成本却能产生威胁,防御方不能仅过滤用户输入,还必须对客户端提交的助手前缀与推理内容实施校验,且模型服务框架应当限制助手预填功能以防范此类攻击。
    完整解读
已经到底了