研究揭示细粒度危害信号在 LLM 安全中的作用
The Role of Fine-grained Harm Signals in LLM Safety
AI 导读
研究通过从各风险类别的危害表征中移除共享的通用危害表征,得到与通用危害性在每一层都正交的类别残差,并用激活引导在 3 个指令微调 LLM 的 11 个风险类别上测试。结果显示,类别残差是否编码危害性因类别而异,且这一类别模式在不同模型间相似;类别残差是否引发拒答同样因类别而异,但这一模式更依赖具体模型。研究还发现类别残差会增强 LLM 下游内部与共享通用危害表征的对齐。作者据此认为,理解 LLM 安全不能只看共享的通用危害表征,还需考虑更细粒度的类别残差;即使某一层上与某概念正交的方向,也可能促进该概念在下游的放大。