攻击arXiv 2610.03166
LiBRA:通过双向隐空间优化实现检测感知的图像水印去除
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
- arXiv
- 2610.03166
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 被测模型
- Stable Signature、YU1、HiDDeN 等 4 个
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
复现 Tree-Ring 语义水印的黑盒伪造并恢复检测统计量
提出黑盒攻击 DRIFT,偏转生成轨迹以去除扩散水印
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒
提出 DITTO 框架,蒸馏提取水印信号并注入外部模型以伪造归属
摘要论文针对大模型水印归属假设的脆弱性,提出黑盒仿冒攻击 DITTO,实现跨架构和采样方案的高检测率与低困惑度仿冒。