跳到正文
原文
arXiv· arXiv:2609.34519· Qirui Liu·本站收录 · 原文发表

EOPSA:高效在策略自蒸馏安全对齐方法

EOPSA: Efficient On-Policy Self-Distilled Safety Alignment

AI 导读

针对在策略自蒸馏(OPSD)安全对齐中监督信号随生成长度增加而崩塌、以及特权提示词引发的风格差异稀释安全梯度两大瓶颈,研究者提出 EOPSA,通过基于 Teacher Rescue Rate(TRR)指标的自适应 rollout 调度与选择性蒸馏,将梯度更新集中在安全关键 token 上。在最高 32B 参数的推理模型上,EOPSA 减少约 50% 的 rollout 计算量,反向传播仅涉及约 2% 的 token,在安全合规与推理能力保持上均优于全 token 蒸馏基线。

阅读原文arxiv.org