论文提出按风险类别测量的对齐缩放定律框架
论文提出分风险对齐标度律,测得Pythia防御算力指数为0.60,Qwen2.5真实性与倾向纠错指数为-0.05与0.48。
- 0.60Pythia分类器Spam任务GCG防御算力指数α(95%区间0.42–0.78)
- -0.05Qwen2.5在0.5B–72B上真实性纠错算力指数α(95%区间-0.39至0.22)
- 0.48Qwen2.5在0.5B–72B上陈述倾向纠错算力指数α(95%区间0.36至0.60)
论文试图解决对齐难度是否随模型规模增大而变化的问题,提出分风险对齐标度律框架与测量协议。
梳理了标度律与对齐税、过度优化与监督、潜伏非对齐等领域研究,指出尚无直接测量对齐负担标度律的工作。
提出分风险对齐标度律定义与三种负担操作化,建立裕度与审计玩具模型,并制定预注册测量协议。
重分析与微调实验测得防御算力指数为0.35至0.60,可见风险呈现标度有益,但盲后门在多数尺寸存活。
作者指出了玩具模型假设简化、未计入评估开销及二选一格式等局限,实验仅覆盖至72B密集模型与QLoRA微调。
论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。