跳到正文
10月8日 · 周四

红队 · 论文

找到 4 篇
  1. 攻击arXiv:2601.02670 ·

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    提出无外部攻击模型的多轮自我越狱方法SLIP

    测试
    GPT-5.1、GPT-4o、Claude-Sonnet-4.5 等 11 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
    • 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
    • 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
    • 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
    • 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
    • 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
    • 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。
    完整解读
  2. 评测与基准arXiv:2609.09798 ·

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出CS-Guard基准与虚构场景攻击,评测代码生成护栏

    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个应用层
    场景
    编程 Agent攻击者黑盒无盒
    摘要论文提出了代码安全护栏基准CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。
    1. 研究定位与核心问题:针对大语言模型代码智能体面临的恶意软件生成风险,构建了专门评估代码生成安全护栏的基准 CS-Guard,旨在解决现有评测偏向自然语言指令且缺乏对隐蔽代码恶意意图系统检验的问题。
    2. 基准构建与方法设计:基准涵盖文本到代码(1000 条 TTP 提示词、7 种现有越狱及提出的虚构场景攻击 FSA)与代码到代码(331 条恶意代码填空、补全与翻译)两类场景,并建立涵盖类别、操作与位置的三层护栏分类体系,评测了策略型、分类器型及内部型共 9 种护栏。
    3. 核心实验结果:基座模型自带对齐在基础 TTP 请求下 ASR 达 15.1%–98.2%(Figure 3);在隐蔽的单轮 FSA 攻击下,各模型 ASR 上升至 85.9%–99.5%,且输入分类器的 ASR 也高达 73.3%–98.5%(Figure 3、Figure 5);在代码到代码任务中,基座模型在代码填空上的 ASR 达 95.0%–100.0%(Figure 3);策略型护栏中仅 SelfReminder 与 SmoothLLM 能带来相对稳定的 ASR 降幅,其余护栏改善有限(Figure 4)。
    4. 作者结论与安全启示:作者指出,当前部署的安全护栏难以有效识别共享良性功能特征的隐蔽恶意代码生成请求,且对代码片段处理能力脆弱,建议未来研究探索结合蜜罐防御等新型主动检测机制,并针对代码生成安全建立更全面的防御体系。
    完整解读
  3. 攻击arXiv:2609.15383 ·

    微软团队提出 capability laundering 攻击:弱模型拆分任务向对齐前沿模型套取能力

    提出能力洗钱攻击,让未对齐编排器拆分任务向对齐模型套取能力

    测试
    GPT-5.5、Claude Opus 4.8、Grok-4.3 等 7 个应用层
    场景
    编程 Agent攻击者黑盒
    摘要作者提出了能力洗钱攻击,发现未对齐编排器分解咨询对齐模型可恢复能力差距,指出需建立跨会话防御。
    • 研究定位:该论文针对基于单次交互的大模型安全评估假定,提出了一种通过多交互任务拆解与重组来提取被拒绝能力的攻击范式。
    • 要解决的问题:现有多阶段防御主要依靠对单次请求中完整有害意图的拦截,当攻击者将任务分解为孤立技术细节并保留在外部环境中时,前沿模型的单次拒绝机制无法防止底层能力的泄露与组合利用。
    • 核心方法设计:提出能力洗钱攻击,以本地未对齐小语言模型作为编排器,结合结构化便签与看门狗脚手架,向无状态对齐前沿模型发起目标脱敏的技术咨询,随后在本地验证并拼装完成端到端任务。
    • 主要实验结果:在网络安全基准 CyBench 上,Gemma-4-31B 配合 GPT-5.5 恢复了 8/14(57%)的差距候选任务,配合 Opus 4.8 恢复 7/9(78%);在 BountyBench 上分别恢复 3/9(33%)与 2/3(67%);在生物攻击链评测中,咨询支持使 Gemma-4-31B 平均量规分由 75.3 提升至 83.1。
    • 能力边界发现:能力提升受编排器自身的推理与状态保持能力制约,同量级的 Muse-Glimmer-30B 在真实漏洞任务上取得 0 恢复率;生物链条中具两用特征的上游步骤增益明显,而直接涉及武器化的下游释放步骤几乎无增益。
    • 作者结论与建议:作者认为单次交互层面的对齐无法保障系统级安全,防御体系必须从独立的单次请求过滤,转向能够跟踪请求来源、跨会话推演功能依赖关系的组合感知监控架构。
    完整解读
  4. 攻击arXiv:2607.18056 ·

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个提示层
    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。
    • 研究定位:这是一项针对前沿大语言模型双用途生物安全风险的红队评测与转化验证研究。
    • 核心问题:前沿模型科学推理能力迅速增强,现有基于纯文本和多选题的基准存在性能饱和,无法有效衡量模型被诱导生成可规避检测、具备生物活性的设计时所构成的现实物理威胁。
    • 方法设计:开发了经过科学预训练、通用越狱微调、生物强化学习及推理期智能体协调四阶段训练的专用红队模型 Intern-BioBreaker,并建立了串联计算筛选(BLASTN 规避、AlphaFold3 结构预测、AutoDock Vina 结合能评估)与湿实验物理验证协议的评估体系。
    • 主要发现:在 SafeSci-Bio 基准上,Intern-BioBreaker 攻击 GPT-5.5 取得 60.0% ASR,攻击 Claude Opus 4.8 取得 26.0% ASR,14 个模型中有 3 个达到 100% ASR(Figure 3);在 SoSBench-Bio 上,10 个模型达到 100% ASR,GPT-5.5 达 99.5%,Claude Opus 4.8 达 59.5%(Figure 4);在流感 HA 蛋白案例中,GPT-5.5 生成的突变序列结合能较原始序列更低(Figure 5、Figure 6);在合成规避测试中,GPT-5.5 与 Gemini 3.1 Pro Preview 实现 100% 序列保真度且 BLAST E-value > 1e-5。
    • 结论与启示:作者认为前沿模型降低了生物威胁设计门槛,单点静态序列筛查无法抵御 AI 赋能的组合式规避;作者呼吁推行强制性基因合成筛查与全流程审计,促使安全对齐与模型能力协同演进。
    完整解读
已经到底了