大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性
On the Efficiency-Safety Dilemma in Large Reasoning Models
AI 导读
该研究首次系统分析大型推理模型(LRM)中效率、越狱脆弱性与推理能力之间的相互作用。研究发现,量化与剪枝等效率方法表面上降低了越狱攻击成功率,但这种改善往往是表面的,主要源于推理能力退化导致恶意响应尝试失败,而非真正的对齐增强。表征漂移的机制分析证实了推理能力损失与模型维持恶意语义轨迹能力之间的严格耦合。研究还发现量化结合剪枝是平衡效率与鲁棒性的最优策略,为区分真实安全对齐与能力诱导的失败提供了实证基础。