ACTR:对齐推理链与回答以提升推理大模型的多语言安全
ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs
AI 导读
研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。
相关论文