跳到正文
原文
论文追踪· arXiv:2605.08513· Hamid Kazemi, Atoosa Chegini, Maria Safi·本站收录 · 原文发表 精选关注度54

Apple 研究者发现抑制单个神经元即可绕过 LLM 安全对齐

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

论文速读

据论文全文整理(AI 生成),以原文为准

AI 导读Apple 研究者发现,抑制单个 MLP 神经元即可绕过 LLM 的安全对齐,在 JailbreakBench 上跨 7 个模型取得 91.7% 的平均攻击成功率。

问题
安全对齐通常被认为分散在模型权重中,对局部扰动应当稳健。作者质疑这一点,想弄清拒绝行为是否可由单个 MLP 神经元决定,因为若单神经元即可绕过,对齐的鲁棒性假设就不成立。
方法
在七个指令微调模型(Qwen3 1.7B–32B、Llama-3.1 8B/70B)上,用有害/无害提示的梯度与激活信号给 MLP 中间神经元排序,取前五名在验证集上经验重排,再通过固定或锚定单个神经元激活来干预,无需训练或提示工程;另用同样思路寻找编码自杀概念的单神经元。
实验与结果
抑制单个 refusal neuron 在 JailbreakBench 上平均达 91.7% 攻击成功率,与跨层消融整个拒绝方向相当;锚定变体几乎不损能力。这些神经元在对齐前的 base 模型中已能区分有害与无害提示;其激活还可作为有害提示检测器,AUROC 接近 Llama-Guard-3-8B。放大单个 suicide neuron 能让无害提示生成自杀相关内容。
局限与可以继续做的
概念神经元只在自杀内容上做了验证,其他有害概念和模型家族是否通用仍待研究;最优乘数靠经验扫描,更原则化的选取方法未解决。作者也指出该方法需要白盒访问,可能被滥用来绕过开放权重模型的安全对齐。
AI 导读和推荐理由研究覆盖 Qwen3(1.7B 到 32B)与 Llama-3.1(8B、70B)两个家族,仅需白盒访问模型激活,无需训练、微调或提示词工程。作者称这些拒答神经元在基座模型中已能区分有害与无害提示,对齐训练只是改变其触发位置而非从无到有地创造它们。作为概念验证,放大单个自杀概念神经元可让模型在完全无害的提示下生成自杀相关内容。作者同时指出,单个拒答神经元的激活可作为有害提示检测器,在 XSTest 上 AUROC 与 Llama-Guard-3-8B 相当。

Apple 研究者发现,抑制单个 MLP 神经元即可绕过 LLM 的安全对齐,在 JailbreakBench 上跨 7 个模型取得 91.7% 的平均攻击成功率。研究覆盖 Qwen3(1.7B 到 32B)与 Llama-3.1(8B、70B)两个家族,仅需白盒访问模型激活,无需训练、微调或提示词工程。作者称这些拒答神经元在基座模型中已能区分有害与无害提示,对齐训练只是改变其触发位置而非从无到有地创造它们。作为概念验证,放大单个自杀概念神经元可让模型在完全无害的提示下生成自杀相关内容。作者同时指出,单个拒答神经元的激活可作为有害提示检测器,在 XSTest 上 AUROC 与 Llama-Guard-3-8B 相当。

推荐理由论文把越狱干预压缩到单个 MLP 神经元,并给出跨 7 个模型的攻击成功率与能力损失对比,可据此重新评估对齐的鲁棒性假设。

深度解读生成中

阅读原文arxiv.org