分析与理论arXiv 2609.37914
研究用训练数据归因量化微调数据对涌现性失准的影响
用训练数据归因估计错误建议样本对涌现失准的贡献
- arXiv
- 2609.37914
- 发表
- 场景
- 模型与 API
- 测试
- OLMo 3 7B-SFT、Qwen 2.5 1.5B、Qwen 2.5 3B 等 12 个
- 风险失准与价值偏离
摘要错误建议对涌现失调的贡献不均匀,归因过滤可增减失调,且最有效的是模型自己的分数。
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。