REINS:用 SAE 特征同时抑制有害续写并增强拒答的引导方法
REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features
AI 导读
论文提出 REINS(Refusal-Enhanced INhibitory Steering),在同一个 SAE 特征空间内抑制有害续写特征、增强安全拒答特征,用于推理阶段的行为引导。作者同时构建了 GUISE 数据集,由带复杂包装的有害提示组成,用于系统评估这一失效模式。实验显示,既有单方向 SAE 引导方法在有害提示上无法稳定产生拒答,说明仅增强拒答在有害续写路径仍活跃时可能过弱;而先前方法要么干预力度不足,要么通过模型崩塌获得表面安全。在 GUISE 及其他数据集上,REINS 大幅减少有害回复、明显提升安全拒答,并基本保留通用能力。该工作已被 EMNLP 2026 主会接收。