跳到正文
原文
arXiv:危险能力与安全评测· arXiv:2609.34896· Qirui Liu·· 4 天前

DeShortcut-Align:解耦伪捷径以提升大推理模型安全对齐鲁棒性

DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models

AI 导读

研究者提出 DeShortcut-Align 对齐框架,用于缓解大推理模型安全训练中出现的伪捷径问题。作者发现安全对齐后的模型常把拒答绑定到提示词模板(格式捷径)或敏感关键词(词汇捷径),导致过度拒答与通用能力下降。该方法通过拒答敏感性归因、归因引导的对比增强和反事实一致性正则三个阶段解耦这些捷径,在 7B 和 14B 模型上使模板剥离绕过攻击的性能下降最多减少 72%,过度拒答降低超过 58%。

阅读原文arxiv.org