可解释性arXiv 2609.16247
研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作
提取疼痛方向并检验激活转向是否驱动有害删除选择
- arXiv
- 2609.16247
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct、Llama 3.1 8B/70B base and instruct 等 10 个
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器