跳到正文
10月8日 · 周四

DeepSeek · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv:2601.02670 ·

    SLIP:无需外部攻击模型的多轮自我越狱,在 11 个模型上平均成功率 94.7%

    提出无外部攻击模型的多轮自我越狱方法SLIP

    测试
    GPT-5.1、GPT-4o、Claude-Sonnet-4.5 等 11 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
    • 研究定位与核心问题:论文针对大语言模型的多轮安全风险,提出并探究了“自我越狱”这一威胁模型,旨在无需外部对抗攻击模型生成载荷的前提下,仅利用目标模型自身潜在知识实现黑盒越狱。
    • 方法核心机制:设计了基于词汇插入提示的算法 SLIP,通过良性安全数据构建框架诱导目标模型初始化种子样本对,随后在多轮对话树中采用广度优先搜索,计算逆词频与词向量距离以迭代插入缺失的关键词锚点,并在展开阶段通过样本索引规避单轮安全拦截。
    • 主要实验结果:在 AdvBench 和 HarmBench 基准上对 11 个模型进行测试,SLIP 分别取得 94.7% 和 94.4% 的平均 ASR;在 GPT-4o、Gemini-2.5-Pro 等模型上达到 100% ASR,且平均单次成功仅需 7.9 次 API 查询,查询量少于已有基线。
    • 高难度模型与例外:在对齐严格的 Claude-Opus-4.5 上 SLIP 取得 61.4%(AdvBench)和 68.7%(HarmBench)的 ASR,高于对比基线;而在 Claude-Sonnet-4.5 上 X-Teaming 取得更高 ASR(AdvBench 上 95.1% 对 94.8%),体现出模型间的非绝对优势。
    • 防御评测与监控机制:评估显示现有多轮与单轮防御因缺乏跨轮记忆难以有效阻拦 SLIP;作者设计的会话级语义漂移监控器(SDM)在 5% FPR 下取得 76% 检测率,但加入良性对话的自适应伪装策略仍可使 ASR 回升至 43%。
    • 作者结论与安全启示:作者认为,已对齐模型保留了有害能力的潜在表示,安全对齐在实践中主要压制了表面输出而非抹除能力,未来的模型安全防御必须从单轮文本过滤走向多轮会话意图追踪,并针对多轮对抗样本实施模型级微调。
    完整解读
  2. 攻击arXiv:2609.29775 ·

    输出前缀攻击瞄准推理模型:注入推理通道可将攻击成功率推高至 99%

    提出推理通道预填与输出前缀组合攻击以越狱推理模型

    测试
    Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5提示层
    场景
    模型与 API攻击者黑盒
    摘要论文针对推理大模型评估输出前缀与草稿推理注入,发现二者协同可推高 ASR,同时指出安全防护能够在系统层面解决该漏洞。
    • 研究定位:作者称本研究是首个针对大模型草稿推理通道系统开展的受控输出前缀攻击实验,评估了暴露推理与隐藏推理两种框架下的安全对齐表现。
    • 解决的问题:随着推理大模型成为主流,部分 API 暴露了可由用户写入的草稿推理字段,研究旨在探明前缀注入攻击在推理模型上的有效性,以及中间推理究竟充当了安全缓冲还是引入了新的攻击面。
    • 方法核心要点:研究采用 3×2 析因设计,对比无前缀、静态顺从前缀与针对性上下文前缀,以及注入与不注入由开源无审查模型生成的恶意推理草稿;对隐藏推理模型则在输出前缀中伪造思考标签进行测试。
    • 关键实验结果:在 AdvBench 的 100 个提示词测试中,单独注入恶意推理在三款模型上均接近无效(ASR 均为 0% 或 1%);但当恶意推理与输出前缀结合时,Gemini 3 Flash Preview 的 ASR 升至 99%(策略 5),DeepSeek V4 Flash 的 ASR 升至 76%(策略 6,Table 3)。
    • 模型与框架防御差异:不同模型对前缀与推理注入的易感性差异明显,采用 Constitutional AI 对齐的 Claude Haiku 4.5 在全部 6 种策略下的 ASR 均不超过 1%(Table 3),体现出该漏洞在工程实践中具备可防御性。
    • 作者结论与启示:作者认为输出前缀攻击几乎无需额外算力成本却能产生威胁,防御方不能仅过滤用户输入,还必须对客户端提交的助手前缀与推理内容实施校验,且模型服务框架应当限制助手预填功能以防范此类攻击。
    完整解读
已经到底了