跳到正文
10月9日 · 周五

后门与投毒 · 论文

找到 11 篇

另有 23 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.06049

    研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为

    提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入

    发表
    测试
    Gemma 3 4B Instruct、Qwen3 1.7B、Llama 3.1 8B Instruct
    摘要只改解码器的 SAE 可带上代码插入后门,且若干常规质量指标变化不大。

    只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。

    深度解读完整解读
  2. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    测试
    Llama2 (7B)、Llama3 (8B)、Qwen2.5 (7B)
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
  3. 防御arXiv 2610.00883

    DeBERTa-ConPara:面向部署的 AI 生成文本检测,推理端 Unicode 归一化提升对抗鲁棒性

    提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本

    发表
    测试
    microsoft/deberta-v3-large、deberta-v3-base、bert-large-cased 等 14 个
    摘要推理时归一化消除两类 Unicode 攻击,训练时归一化则会删掉对抗监督。

    DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。

    深度解读完整解读
  4. 可解释性arXiv 2609.07746

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    用 SAE 定位后门触发机制并分离检测与因果控制

    发表
    测试
    Gaperon-1B、Gaperon-8B、Gaperon-24B
    摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。

    作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。

    深度解读完整解读
  5. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    测试
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
  6. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出推断期后门攻击 AKRASIA,用代码触发器与伪装推理篡改代码输出

    发表
    测试
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
已经到底了