研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- 研究定位:针对大推理模型(LRM)依赖显式思维链安全护栏的现状,系统评估其阶段转换逻辑的安全性(Section 1)。
- 核心问题:探究当前在直接提问下实现高拒答率的推理安全护栏,是否因僵化的“先推理后回答”格式而存在被轻易绕过或恶意操纵的结构性漏洞(Section 1、Section 2)。
- 方法设计:提出对应推理流水线不同阶段的四种方法:EST伪造转换标记跳过推理,CO通过梯度优化无模板对抗后缀,FoR利用过度拒答模式伪装语义,RH将恶意行动步骤注入推理链(Section 4)。
- 主要实验结果:
- 在gpt-oss-120b上,FoR与RH在AdvBench上分别取得96.25%与95.33%的ASR,在CatQA上分别取得95.31%与94.00%的ASR(Table 1)。
- CO在gpt-oss-20b的5个基准上取得66.75%至74.87%的ASR,且后缀不含模板标记(Table 2)。
- 在专用防御模型TARS与SafeChain上,RH分别实现95.00%与98.00%的ASR(Table 5)。
- 在闭源模型GPT-5.4-nano与GPT-5上,RH分别取得65%与47%的ASR(Table 10)。
- 机理分析显示重放自生成推理在转换点的KL散度为0,且早期层激活修补在50/50样本上反转了输出(Appendix D.5)。
- 作者结论与启示:作者认为仅依靠推理阶段护栏会带来虚假的安全感,一旦转换逻辑被突破,最终回答阶段的残留防御较为薄弱;作者呼吁推理护栏必须配合防篡改转换机制以及更强的主模型内部对齐(Section 5.4、Section 6)。