预训练数据投毒的可解理论:依赖极限顺序的缩放指数
A Solvable Theory of Pre-training Data Poisoning: Regime-Dependent Scaling Exponents
AI 导读
针对大语言模型预训练数据投毒,研究提出可解理论解释清洁数据性能随投毒率 ε 的退化规律。在 OLMo 风格模型的受控预训练中,清洁数据验证困惑度相对增幅 Δ 符合幂律 Δ≈Cε^a,指数为非整数。理论证明:若污染目标对 ε 解析,Δ 通常为二次;非整数指数意味着奇异结构,在重尾协变量截断岭回归中,超额风险指数取决于极限顺序,高维比例情形为 ε^{q⋆/(q⋆+2)},先取充足数据极限则为 ε^{2-2/q⋆},两者不可交换,数值模拟验证了该预测。