- 攻击arXiv 2610.06049
研究者提出仅修改 SAE 解码器的后门攻击,可在不改动语言模型的情况下植入行为
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
- arXiv
- 2610.06049
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要只改解码器的 SAE 可带上代码插入后门,且若干常规质量指标变化不大。
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。
- 防御arXiv 2608.00716
生成图像更易被遗忘:面向合成图像检测的机器遗忘视角
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
- arXiv
- 2608.00716
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要作者用剪枝或 LoRA 遗忘拉开生成图与自然图的特征相似度,并在多个检测基准上报告结果。
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
- 防御arXiv 2610.00348
NEEDLE:通过权重正交化移除 LLM 后门
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
- arXiv
- 2610.00348
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
- 防御arXiv 2609.27399
GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别
提出 GUARD,在零样本 TTS 上用激活转向遗忘说话人身份以阻止再识别
- arXiv
- 2609.27399
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要GUARD 用门控激活转向把退出说话人推向冒充相似度,以抑制再识别并保住音质。
GUARD 用门控激活转向做说话人身份遗忘,使零样本 TTS 对退出说话人难以再识别。
- 防御arXiv 2609.00786
MROP:针对 Deep JSCC 后门攻击的掩码区域优化净化方法
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
- arXiv
- 2609.00786
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要MROP 不重训练,在发射端纯化补丁后门。
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 可解释性arXiv 2609.07746
LLM Forensics:用稀疏自编码器定位并控制后门触发机制
用 SAE 定位后门触发机制并分离检测与因果控制
- arXiv
- 2609.07746
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击投毒与后门
摘要Gaperon 语言切换后门可分成检测、残差路由和后期语言跟踪三类 SAE 特征,只有部分能改行为。
作者用稀疏自编码器分解 Gaperon 中无害的语言切换后门,区分识别触发的特征与真正能抑制或诱发该行为的特征。固定触发使英语提示在 Gaperon-1B 与 8B 上续写成法语或德语。
- 防御arXiv 2609.39548
NDDL:用正常扩散动力学为文生图模型做后门防御
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
- arXiv
- 2609.39548
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。