可解释性arXiv 2607.17117
Persistent SAE:为语言模型特征学习特定时间尺度
提出 Persistent SAE,为语言模型特征学习特定时间尺度
- arXiv
- 2607.17117
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要占位。
占位。
提出 Persistent SAE,为语言模型特征学习特定时间尺度
占位。
比较用于审计提示注入与隐瞒的 token 位置选择信号
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。