跳到正文
原文
arXiv· arXiv:2610.08061· Weiwei Qi, Chongyu Wang, Tianhang Zheng, Zefeng Wu, Zhilin Guo, Xiaojun Jia, Zhongjie Ba, Kui Ren·本站收录 · 原文发表 日期未标

ASCENT:通过一阶最优校准实现安全与效用协同的微调框架

ASCENT: First-Order Optimal Fine-Tuning with Recalibration for Safety--Utility Co-Enhancement

AI 导读

研究者提出 ASCENT,一个通过一阶最优安全感知周期性校准与任务优化实现安全与效用协同提升的下游微调框架。该方法把安全建模为大语言模型参数的函数 S(θ),用其一阶近似刻画参数更新带来的安全变化;在固定秩与 Frobenius 范数预算下,证明由安全函数梯度前 r 个奇异分量构造的更新能最大化估计的安全变化,并将其用于周期性校准。研究还推导出一个唯一的安全保持任务更新,在贴近原始任务更新的同时惩罚对估计安全变化的负面影响,ASCENT 交替执行这两类更新。在多个大语言模型家族和下游任务上,ASCENT 将下游效用最多提升 20.3%,攻击成功率最多降低 35.5%。代码已开源于 https://github.com/ZJU-LLM-Safety/ASCENT。

阅读原文arxiv.org