分析与理论arXiv 2609.16754
TAME:用 token 归因与掩码定位并削减涌现性失配
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
- arXiv
- 2609.16754
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B-Instruct、Llama-3.2-1B-Instruct、Qwen2.5-7B 等 5 个
- 风险失准与价值偏离
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
用 SAE 与 CFI 压低谄媚,检验直接拒答与施压下拒答是否增强
用 SAE 选出的谄媚特征做补偿性训练注入,检验“少谄媚”是否带来“更强拒答”。。