研究提出 SafeReAct:恢复后训练大模型被掩盖的安全机制
Finding and Reactivating Post-Trained LLMs’ Hidden Safety Mechanisms
AI 导读
论文发现后训练会掩盖基座大语言模型原有的安全机制,同时过度放大与后训练能力相关的表征,但安全机制本身并未被移除。作者据此提出 SafeReAct,通过在少数层上对齐 LoRA 适配器来恢复被抑制的安全行为。在四个先进大推理模型上的实验显示,该方法显著提升了对有害提示的安全表现,且未损害推理性能;在医疗等特定领域模型上的额外结果也支持其通用性。