跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.37054· Xianhui Zhang·· 2 天前

ACTR:对齐推理与回答以提升推理大语言模型的多语言安全

ACTR: Aligning Thoughts and Responses for Multilingual Safety in Reasoning LLMs

AI 导读

研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。

阅读原文arxiv.org