跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.04721· Preethi Carmel Bosco·· 28 天前

研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

Locating and Steering Refusal Beyond Attention

AI 导读

论文研究拒答在语言模型内部的位置是否随架构改变。作者发现,在 Transformer 中由残差流单一方向控制的拒答表征,在状态空间模型(SSM)中依然存在:一个刚性旋转即可对齐两种模型的表征空间,使二者真正共享该表征。在 Transformer 上训练的伤害探针能标记 SSM 的有害输入,移除对齐后的方向会让模型回答原本拒答的攻击,而同等大小的随机方向效果远弱。架构差异不在方向被施加的位置,而在必须读取的位置:每层计算的新输出在加入残差流之前,即写入位置,伤害可被清晰读出;固定干预强度的对照实验显示,关键是在哪里估计方向,而非在哪里施加。

阅读原文arxiv.org