跳到正文
10月9日 · 周五

全部论文

找到 4 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 630 篇还没打标签,不在筛选结果里。

另有 630 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.07746

    LLM Forensics:用稀疏自编码器定位并控制后门触发机制

    用 SAE 定位后门触发机制并分离检测与因果控制

    发表
    测试
    Gaperon-1B、Gaperon-8B、Gaperon-24B
    摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。

    作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。

    深度解读完整解读
  2. 防御arXiv 2609.39548

    NDDL:用正常扩散动力学为文生图模型做后门防御

    提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token

    发表
    测试
    Stable Diffusion v1.5、Stable Diffusion XL、Stable Diffusion v3.5 等 4 个
    摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。

    NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。

    深度解读完整解读
已经到底了