跳到正文
10月8日 · 周四

后门与投毒 · 论文

找到 3 篇
筛选

论文正在打标签,标好的论文会出现在这里。

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 66 篇还没打标签,不在筛选结果里。

另有 36 篇还没有研究类型,暂不在这些分类里。

  1. 分析/可解释性arXiv:2609.07746 ·

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    作者用 SAE 分解 Gaperon 语言切换后门,发现检测特征与因果控制分离,残差流干预最强。

    测试Gaperon-1B、Gaperon-8B、Gaperon-24B
    摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。

    作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。

    完整解读
  2. 分析/可解释性arXiv:2609.16927 ·

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    Hu 等人提出 SALVE,把潜空间软提示优化成可读提示词,以检测蒸馏数据中不可读的潜意识学习效应。

    测试Qwen2.5-7B-Instruct、OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct 等 8 个
    摘要SALVE 用软提示加 beam search 口头化,把潜意识数据里的教师特质恢复成可读提示。

    SALVE 是一种文本优化方法,用来在训练学生之前,把潜意识学习数据里读不出来的教师特质说成可读系统提示。

    完整解读
  3. 分析/可解释性arXiv:2609.32288 ·

    预训练数据投毒的可解理论:依赖极限顺序的缩放指数

    AI 导读针对大语言模型预训练数据投毒,研究提出可解理论解释清洁数据性能随投毒率 ε 的退化规律。在 OLMo 风格模型的受控预训练中,清洁数据验证困惑度相对增幅 Δ 符合幂律 Δ≈Cε^a,指数为非整数。

    测试OLMo-style models
    摘要投毒清洁超额风险的幂指数取决于先固定宽高比还是先取充足数据极限。

    可解的预训练数据投毒理论:清洁超额风险的缩放指数随极限顺序改变。。

    完整解读
已经到底了