LLM Forensics:用稀疏自编码器定位并控制后门触发机制
作者用 SAE 分解 Gaperon 语言切换后门,发现检测特征与因果控制分离,残差流干预最强。
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。
另有 36 篇还没有研究类型,暂不在这些分类里。
作者用 SAE 分解 Gaperon 语言切换后门,发现检测特征与因果控制分离,残差流干预最强。
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。
Hu 等人提出 SALVE,把潜空间软提示优化成可读提示词,以检测蒸馏数据中不可读的潜意识学习效应。
SALVE 是一种文本优化方法,用来在训练学生之前,把潜意识学习数据里读不出来的教师特质说成可读系统提示。
针对大语言模型预训练数据投毒,研究提出可解理论解释清洁数据性能随投毒率 ε 的退化规律。在 OLMo 风格模型的受控预训练中,清洁数据验证困惑度相对增幅 Δ 符合幂律 Δ≈Cε^a,指数为非整数。
可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。