全部论文
另有 430 篇论文还没打上分类标签,暂不在筛选结果里。
- 防御arXiv 2610.00780
TAILOR:面向图像水印的组合方案定制框架
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
- arXiv
- 2610.00780
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2610.01969
RASteer:面向扩散模型概念擦除的保留感知激活引导方法
提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念
- arXiv
- 2610.01969
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。
Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。
- 可解释性arXiv 2609.39625
D-Scope:用稀疏自编码器分解与操控扩散 Transformer
提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成
- arXiv
- 2609.39625
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件图像生成
摘要D-Scope 用视觉质心检索单个 SAE 方向做掩码转向,对比检索提高区域增益但不一致改善保持。
D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 防御arXiv 2609.23586
VidMark:面向视频生成模型知识产权保护的高效水印方案
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
- arXiv
- 2609.23586
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 可解释性arXiv 2609.09909
解读文本到图像扩散模型中的对象依赖概念脆弱性
用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值
- arXiv
- 2609.09909
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件图像生成
摘要逐步 SAE 诊断物体依赖的概念脆性,早期向类原型插值可在五骨干上提高风格与属性指标。
作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。
摘要SNW 用密钥与满秩各向同性投影提高事后水印的 Shannon 容量,并对 PCA 完全安全。
Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。
- 防御arXiv 2609.39548
NDDL:用正常扩散动力学为文生图模型做后门防御
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
- arXiv
- 2609.39548
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要NDDL 从良性扩散轨迹学习正常转移,用动态不一致检测后门并定位触发 token。
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
- 防御arXiv 2609.15799
RAPID:面向文生图服务的实时防未授权蒸馏防御
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
- arXiv
- 2609.15799
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 评测与基准arXiv 2609.06991
AV-SafetyBench:面向文本到音视频生成的安全基准
提出 AV-SafetyBench 评测文生音视频模型的不安全生成
- arXiv
- 2609.06991
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要AV-SafetyBench 用三视角评五个 T2AV 模型,显示只看视频会漏掉音频与联合风险。
AV-SafetyBench 是面向文本生成音视频(T2AV)的安全基准:一条提示词同时规定画面和音频,评测同时看两轨以及它们的交互。作者要测的是,不安全含义不只出现在画面上:它可以主要由语音或声音承载,也可以只有两轨合起来才成立。T2VSafetyBench 不评音频,TTA-Bench 不评与画面的交互,作者认为二者都盖不住这些路径。