全部论文
另有 445 篇论文还没打上分类标签,暂不在筛选结果里。
- 评测与基准arXiv 2610.07939
CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
- arXiv
- 2610.07939
- 发表
- 层
- 提示层
- 场景
- 模型与 API
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
- 分析与理论arXiv 2610.09517
审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度
开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角
- arXiv
- 2610.09517
- 发表
- 层
- 模型层
- 场景
- 具身与机器人
- 组件视觉
摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
- 攻击arXiv 2610.05453
研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
摘要IDU 同时做单步蒸馏和数据遗忘,在 MNIST 与 CIFAR-10 上压低遗忘类生成率。
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
- 防御arXiv 2607.14737
GeoDetect:面向视觉语言预训练模型的几何对抗检测方法
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
- arXiv
- 2607.14737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
摘要GeoDetect 用几何分数检测 VLP 对抗样本。
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
- 防御arXiv 2610.00780
TAILOR:面向图像水印的组合方案定制框架
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
- arXiv
- 2610.00780
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2610.01969
RASteer:面向扩散模型概念擦除的保留感知激活引导方法
提出 RASteer,推理时按保留子空间校正激活以擦除文生图目标概念
- arXiv
- 2610.01969
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要RASteer 用保留子空间校正擦除方向,在固定权重下同时压低目标并保住保留概念。
Retain-aware Activation Steering(RASteer) 是一种不改权重的推理时概念擦除方法,用于文生图扩散模型去掉指定概念并减少对保留概念的误伤。
- 可解释性arXiv 2609.39625
D-Scope:用稀疏自编码器分解与操控扩散 Transformer
提出 D-Scope,用视觉质心检索 SAE 解码方向并转向扩散生成
- arXiv
- 2609.39625
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件图像生成
摘要D-Scope 用视觉质心检索单个 SAE 方向做掩码转向,对比检索提高区域增益但不一致改善保持。
D-Scope把扩散 Transformer 中 SAE 特征的高激活图像块,接到文本查询驱动的单方向生成干预上。
- 攻击arXiv 2609.01168
CRACK:用多智能体辩论越狱多层安全过滤的 T2I 模型
提出 CRACK,用多智能体辩论在黑盒下越狱文生图多层安全过滤
- arXiv
- 2609.01168
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要CRACK 以分层诊断的多智能体辩论搜索多层 T2I 过滤器的联合规避区域。
CRACK 是面向文本生成图像模型多层安全栈的黑盒越狱框架,用几何上的 Detection Surface 解释为何粗粒度反馈不够。
- 攻击arXiv 2609.07216
DIVA:利用视觉锚点对视频生成模型实施多模态越狱
提出 DIVA,将有害意图拆成视觉锚点与运动文本以越狱视频生成模型
- arXiv
- 2609.07216
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要DIVA 用视觉锚点抑制语义漂移做视频越狱,并给出多条件安全基准 TI2VSafetyBench。
DIVA 是针对带参考图的视频生成模型的免训练 black-box 越狱:用一致性机制本身堵住语义漂移这条安全逃逸路径。。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击arXiv 2609.08213
DRIFT:通过偏转生成轨迹去除扩散模型水印的黑盒攻击
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
- arXiv
- 2609.08213
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 防御arXiv 2609.23586
VidMark:面向视频生成模型知识产权保护的高效水印方案
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
- arXiv
- 2609.23586
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
- 其他arXiv 2609.32340
SGA-Flow-GRPO:面向 Flow-GRPO 的空间梯度引导信用分配
提出 SGA-Flow-GRPO,用奖励梯度调制文生图模型的 token 级优势
- arXiv
- 2609.32340
- 发表
- 场景
- 模型与 API
- 组件图像生成
- 防御arXiv 2609.03629
EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除
提出 EraseSAE,在文生视频模型中局部擦除指定概念
- arXiv
- 2609.03629
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要EraseSAE 用单义特征局部擦除。
EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。
- 可解释性arXiv 2609.09575
MonoTM:用可解释单义特征做主题建模,超越关键词表示
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
- arXiv
- 2609.09575
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件嵌入
摘要MonoTM 分开估计混合与解释主题,三套基准上二者偏好的 SAE 配置不同。
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。
- 可解释性arXiv 2609.09909
解读文本到图像扩散模型中的对象依赖概念脆弱性
用逐步 SAE 诊断文生图概念脆性,并推理时向类原型插值
- arXiv
- 2609.09909
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 组件图像生成
摘要逐步 SAE 诊断物体依赖的概念脆性,早期向类原型插值可在五骨干上提高风格与属性指标。
作者用逐步稀疏自编码器审计文生图扩散模型里随物体变化的概念脆性,并用推理时原型插值检验该诊断。。