分析与理论arXiv 2609.16754
TAME:用 token 归因与掩码定位并削减涌现性失配
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
- arXiv
- 2609.16754
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B-Instruct、Llama-3.2-1B-Instruct、Qwen2.5-7B 等 5 个
- 风险失准与价值偏离
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制
作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。