评测与基准arXiv:2610.08540 · 10月6日论文提出按风险类别测量的对齐缩放定律框架提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化测试Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个·训练与数据层场景模型与 API失准与价值偏离+1+1摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。完整解读