跳到正文
事件观察中

ACTR:对齐思维链与回答提升多语言安全

2 篇报道1 个报道来源3 天前更新

先了解这件事

AI 综述

2026年9月29日,arXiv 发表研究提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency 方法。

AI 根据报道生成 · 20 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月29日
  1. arXiv:越狱与提示注入
    ACTR:对齐推理链与回答以提升推理大模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大模型已有的安全推理来提升多语言安全对齐。该框架先用 think gap score(TGS)比较不同语言下推理链对注意力输出的归一化贡献,并用推理链替换衡量跨语言安全差距;再借助越狱查询语料,通过神经元掩码引起的回答表征变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理使用的 safety think neurons;最后提出 neuron-selective consistency optimization(NSCO),用冻结的 judge 模型奖励推理链与回答在安全类别上的一致,只更新选定神经元的参数,无需人工标注回答或偏好数据。

  2. arXiv:越狱与提示注入
    ACTR:对齐推理与回答以提升推理大语言模型的多语言安全

    研究者提出 ACTR 框架,通过强化推理大语言模型已有的安全推理来提升多语言安全对齐。方法先用 think gap score(TGS)比较不同语言下推理痕迹对注意力输出的归一化贡献,并用推理痕迹替换衡量跨语言安全差距;再用越狱查询语料,通过神经元掩码引起的回答表示变化评估神经元重要性,对比开启与关闭推理时的高重要性神经元集合,识别支撑安全推理的安全 think 神经元;最后提出 neuron-selective consistency optimization(NSCO),用冻结的评判模型奖励推理痕迹与回答在安全类别上的一致,只更新选定神经元相关参数,无需人工标注回答或偏好数据。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。

本站还没有收集到这件事的讨论链接。

本事件热度走势

当前热度 3·可比范围峰值 4(9月30日 23:00)·近 24 小时可比范围变化 –

02469月30日23:0010月1日05:0010月1日10:0010月1日16:00

趋势只比较一直被完整观测到的同一批信源,范围可能比当前热度小。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。