可解释性arXiv 2609.04721
研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
- arXiv
- 2609.04721
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。
提出 EraseSAE,在文生视频模型中局部擦除指定概念
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。