MBZUAI 提出可校准的真实图像认证方法
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
- arXiv
- 2610.05870
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 白盒
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动
摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
提出 TRACER,从权重差识别扩散模型被擦除概念
TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格
提出带密钥的 SNW,抵御事后图像水印的身份伪造
Gesny 与 Giboulot 针对生成内容追溯所依赖的多比特事后图像水印,批评端到端 DNN 方案既无容量理论、又无密钥。
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
复现 Tree-Ring 语义水印的黑盒伪造并恢复检测统计量
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
复现 AgentCF 上的多智能体攻防并刻画连通性作用
作者在 AgentCF 上研究连通性如何改变多智能体协同过滤的攻防,复现已有方法而不是提出新载荷。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
提出 Prometheus,从展示图反推文生图模型的在售提示词
Prometheus 是针对文生图市场 showcase 的训练无关提示词窃取:攻击者看不到在售文本,只用本地开源 proxy 恢复 subject 和 modifier,并希望换 subject 后风格仍在。