跳到正文
原文
arXiv:后门、投毒与隐私· arXiv:2609.32288· Indranil Halder·· 6 天前

预训练数据投毒的可解理论:依赖极限顺序的缩放指数

A Solvable Theory of Pre-training Data Poisoning: Regime-Dependent Scaling Exponents

AI 导读

针对大语言模型预训练数据投毒,研究提出可解理论解释清洁数据性能随投毒率 ε 的退化规律。在 OLMo 风格模型的受控预训练中,清洁数据验证困惑度相对增幅 Δ 符合幂律 Δ≈Cε^a,指数为非整数。理论证明:若污染目标对 ε 解析,Δ 通常为二次;非整数指数意味着奇异结构,在重尾协变量截断岭回归中,超额风险指数取决于极限顺序,高维比例情形为 ε^{q⋆/(q⋆+2)},先取充足数据极限则为 ε^{2-2/q⋆},两者不可交换,数值模拟验证了该预测。

阅读原文arxiv.org