防御arXiv 2610.05870
MBZUAI 提出可校准的真实图像认证方法
提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书
- arXiv
- 2610.05870
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 测试
- SD2.1、SD3、SD3.5 等 10 个
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出机器遗忘式生成图像检测,用遗忘前后特征相似度区分自然图与生成图
这篇工作把 AI 生成图像检测写成对预训练视觉模型的机器遗忘:原模型对两类图像损失都低,剪枝后生成图特征变得更不像原模型。
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门
摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。
提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 MROP,在发射端推理时纯化输入以抵御训练投毒后门
MROP 是 deep JSCC 无线图像传输上的推理时输入纯化,对象是矩形补丁后门。
提出带密钥的 SNW,抵御事后图像水印的身份伪造
Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。
提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱