分析与理论arXiv 2609.16754
TAME:用 token 归因与掩码定位并削减涌现性失配
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
- arXiv
- 2609.16754
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3.1-8B-Instruct、Llama-3.2-1B-Instruct、Qwen2.5-7B 等 5 个
- 风险失准与价值偏离
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
提出多组 IRT 框架拆解跨语言安全护栏退化原因
Zhang、Patel、Truong 与 Koyejo 用多组项目反应理论,解释安全护栏为何随语言变化,而不是只报告一个 JSR。
提出 harm laundering,证明安全训练改写而非消除性别歧视
Wyer、Black 与 Al Moubayed 用 OpenAI GPT 谱系检验:毒性分数下降是否等于歧视减少。 他们的答案是否定的,并把“显性伤害被改写成评测指标看不见的形式”称为 harm laundering。
用物理陷阱模型描述 Best-of-N 越狱的攻击面规律
Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。
用语义保留变换探针比较效用与对齐在分布偏移下的稳定性
摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。