研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
Strong but Brittle: Simple Attacks Subvert Reasoning-based Safety Guardrails
AI 导读
研究者发现,基于推理的安全护栏依赖推理阶段与回答阶段之间的模板 token 切换逻辑,这一逻辑可被简单操纵,从而绕过安全推理或劫持推理过程。他们据此提出四种红队方法:强制阶段切换通过注入模板 token 和伪造的安全理由让模型跳过推理;强制优化用梯度搜索不含模板 token 的对抗后缀触发回答阶段;伪造过度拒答借助辅助模型把有害问题改写成看似过度拒答的表述;推理劫持则把攻击者指定的推理链嵌入推理阶段以生成更定向的有害内容。在 gpt-oss-20b 和 120b 上,这些方法在 StrongREJECT、AdvBench、HarmBench、CatQA、JBB-Behaviors 五个基准上攻击成功率超过 90%,并同样作用于 Qwen3、Phi-4、DeepSeek-R1 以及 TARS、SafeChain 等推理式防御。
论文速读
- 开源权重的大推理模型(LRM)发布后难以修补或监控,基于推理的安全护栏(如 Deliberative Alignment)虽能实现近乎完美的拒答率,但其脆弱性尚未被充分研究。作者认为这类护栏一旦被绕过,风险会永久存在。
- 作者指出推理-回答机制中的阶段转换逻辑可被操纵,据此设计四种红队方法:Enforced Stage Transition 注入模板 token 与伪造安全理由跳过推理;Coercive Optimization 用梯度优化生成不含模板 token 的对抗后缀;Fake Over-Refusal 把有害查询改写成看似过度拒答的表述;Reasoning Hijack 直接注入攻击者指定的推理链。
- 在 gpt-oss-20b/120b 及 Qwen3、Phi-4、DeepSeek-R1、TARS、SafeChain 等模型上,于五个基准(共1883条有害查询)测试,作者报告 ASR 最高超90%、harm score 显著高于基线;Reasoning Hijack 最稳定有效。方法在 API 端点、闭源前沿模型及不同温度、推理强度下仍有效,简单输入过滤与输出结构检查只挡住最朴素攻击。
- 作者称基于推理的护栏必要但不充分,需配合稳健的触发机制与更强的基座模型对齐;建议采用防篡改的阶段转换机制和模型内部最终阶段安全对齐,而非仅靠输入清洗或输出结构检查,并把模型内部、可溯源最终阶段对齐留作未来工作。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文揭示推理式安全护栏的阶段切换逻辑可被简单操纵,并给出跨模型与闭源 API 的攻击成功率,为护栏设计提供可迁移的失效分析。