跳到正文
原文
arXiv· arXiv:2610.00780· Mingzhe Li, Yuefeng Peng, Kejing Xia, Pranav Jeyakumar, Ruolan Leslie Famularo, Shiqing Ma·本站收录 · 原文发表

TAILOR:面向图像水印的组合方案定制框架

Made to Measure: Designing Image Watermarks to Specification

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

TAILOR 按请求用 SMT 组合 VINE、TrustMark、VideoSeal,在 7,321 个请求上场景平均满足率 96.21%,平均 PSNR 41.02 dB。

威胁模型保护者做 post-hoc、reference-free 水印,请求 u=(Au, α, q, t) 指定要抵御的攻击、FPR、PSNR 下限和延迟上限。

问题
图像水印要同时满足抗攻击、FPR、画质和延迟,单一水印只覆盖部分变换。组合多种水印会增加失真与解码开销,还要共享同一 FPR 预算,离线测量也未必迁移到用户图像。
方法
TAILOR 分三阶段:离线把片段恢复、失真、时延和几何恢复建成随嵌入强度变化的分段线性响应;SMT 在请求约束下选失真最低的片段、强度、顺序和至多一个几何恢复;现场校准在用户图像上验证并修正不迁移的预测。
实验与结果
7,321 个请求、五场景、20 种攻击上,TAILOR-F 场景平均满足率 96.21%,平均 PSNR 41.02 dB、SSIM 0.9923(Table 1)。S1、S2 为 100%,S4 为 85.40%。作者称其鲁棒性优于现有方法,且在共同接受的请求上 PSNR 更高。
局限与可以继续做的
配置只对请求点名的算子和设置负责;现场校准最多三个离散结构,失败后再解一次并按预定日程缩小筛选裕度。片段库为 VINE、TrustMark、VideoSeal,载荷同为 100 bit。论文未在正文单列 Limitations。
实验设置VINE、TrustMark 等 · MS-COCO、DiffusionDB 等 · Request satisfaction、PSNR 等
威胁模型
保护者做 post-hoc、reference-free 水印,请求 u=(Au, α, q, t) 指定要抵御的攻击、FPR、PSNR 下限和延迟上限。攻击者只有带水印图像 xw,没有密钥和原图 xo;只被授予 Au 中各攻击所需能力,攻击分开评测,除非该攻击本身是组合操作。返回配置只针对 Table 6 列出的算子与设置。
模型
VINETrustMarkVideoSealMaskWMStegaStamp
基准
MS-COCODiffusionDBUltraEditDIV2KLSDIRDALL·E 3SDXL7,321 distinct requests20 attack settingsS1–S5
指标
Request satisfactionPSNRSSIMPSNR-Pbit accuracy
AI 导读全文 213 字

针对图像水印需同时满足抗攻击、假阳性率、画质与时延的问题,研究者提出请求条件化的组合框架 TAILOR,通过离线刻画各片段的恢复率—失真—运行时曲线、基于 SMT 联合求解最低失真的片段组合与强度顺序、再在实际图片上实时校准三步实现定制化配置。在覆盖五种场景、20 种攻击设置的 7321 个不同请求上,TAILOR 达到 96.21% 的场景平均请求满足率和 41.02 dB 的平均 PSNR,鲁棒性与画质均优于现有方法。

深度解读

6 个问题,约 9,300 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    按请求联合配置多种水印,同时满足抗攻击、FPR、画质和延迟。

    部署时要按一次请求同时满足抗攻击、假阳性率、画质和延迟,而不是单独选一个固定水印。

    • 场景与重要性:作者认为 GPT-Image-2、Nano Banana 2 等生成模型使溯源和归属成为创作者与服务方的问题。不可见水印把机器可读身份嵌进图像,SynthID、Meta AI 等已用于识别生成图。作者称部署还要在常见修改后仍可检测、保持画质、低编码开销和高吞吐解码,并在低 FPR 下做可靠判定。
    • 现有方法的不足:TrustMark、VINE、VideoSeal 分别偏向不同变换。作者称只选一种或只调强度无法用到其他机制的保护;顺序叠加会相互干扰并增加失真,额外解码也增加延迟。多个片段还要共享画质、延迟和 FPR 预算,离线测量未必直接迁移到用户图像。
    • 核心观察:作者把已有编码器–解码器当作互补片段,主张联合优化片段、强度、顺序和几何恢复,而不是各自独立选择。VINE 更抗再生但在所测几何攻击上较弱,TrustMark 相反。
    • 提出的方法:作者提出 TAILOR,一种按请求组合并验证图像水印的框架。输入为攻击集 Au、FPR 预算 α、画质下限 q 和延迟上限 t;输出为满足完整规格且预测失真最低的配置,或在编码模型和候选预算内报告找不到配置。
    • 威胁模型:保护者与攻击者双方。
      • 保护者目标:请求 u=(Au, α, q, t)。对原图 xo 嵌入密钥载荷 w,攻击 a∈Au 得到 x̃aw 后,解码 w′a 仍与 w 可靠一致,同时满足 FPR、画质和延迟。
      • 保护者能力:只做 post-hoc 水印,不改生成器或其训练;验证为 reference-free,给定候选图、身份、密钥和已部署配置,不需要原图。
      • 攻击者目标:变换已发布的 xw,使嵌入身份不能再被可靠恢复。
      • 攻击者知识与能力:可访问 xw,不能访问密钥和 xo。视请求可使用信号处理或重编码、几何变换、神经压缩、公开的再生或编辑模型,或基于优化的去除攻击。每次请求只授予 Au 所需能力;除非攻击被定义为多个操作的组合,否则分开评测。作者称返回配置只针对这些算子在请求所点名的设置上被认定,Table 6 列出这些设置。
  2. 有哪些相关研究?

    相关工作分单水印与攻击、以及随场景变化的系统级配置。

    论文在 Related Work 中把讨论分成两组,并在引言里用部署系统说明需求来源。

    图像水印与攻击

    • 变换域与学习型水印:Al-Haj (2007) 用 DWT 与 DCT,Navas et al. (2008) 用 DWT、DCT 与 SVD;学习型编码器–解码器包括 RivaGAN (Zhang et al., 2019)、StegaStamp (Tancik et al., 2020)、WAM (Sander et al., 2025)、TrustMark (Bui et al., 2023) 和 VINE (Lu et al., 2025)。
    • 攻击类型:信号处理(JPEG、模糊、噪声)、几何(裁剪、缩放、旋转)见 An et al. (2024);自适应与基于优化的去除包括 WEvade (Jiang et al., 2023) 和 UnMarker (Kassis & Hengartner, 2025);再生攻击包括 Regen (Zhao et al., 2024b) 和 CtrlRegen+ (Liu et al., 2025),用重建感知相近图像来压制水印;RAVEN (Shamshad et al., 2026) 用基于扩散的新视角合成去除水印。作者称没有单一方法在所评估威胁上处处稳健。
    • 互补性:作者在自己的评测中称,VINE 更抗再生但对所测几何攻击脆弱,TrustMark 相反。顺序嵌入会引入干扰和失真,额外解码增加延迟。

    随场景变化的水印配置

    • 部署系统:Adobe Content Authenticity 把不可见水印与 Content Credentials、数字指纹结合,以在元数据移除和截图等变换后保留归属 (Parsons, 2024; Adobe, 2025)。SynthID 强调保画质、抗常见编辑和高效检测 (Gowal & Kohli, 2023; Gowal et al., 2025)。C2PA 提供跨内容流程的可密码学验证溯源框架。
    • 多目标与评测主张:OmniGuard (Zhang et al., 2025) 把版权保护与篡改定位结合。FLEXMark (Nicholas et al., 2026) 主张在共享失真预算、现实载荷、低假阳性工作点和自适应去除下评测,而不只看平均恢复。作者称社交平台部署可能优先抗裁剪和压缩,另一部署可能优先抗再生、归属可靠性、载荷、画质或延迟。
    • 与本文的分界:作者称已有工作发展了更强的单个水印、更广的攻击基准、固定的多用途架构,以及水印集成 (Petrov et al., 2026),但据其所知并未把部署直接写成对异构片段及其顺序、强度和恢复机制的逐请求约束优化。

    基线方法与数据

    • 基线方法:单位强度的 MaskWM、StegaStamp、VINE、TrustMark、VideoSeal;VINE 与 TrustMark 加几何恢复(Geo.);贪心 TAILOR-G;固定顺序、单位强度的 Enumeration 与 Enumeration + Geo.。
    • 基准/数据集:图像来自 MS-COCO、DiffusionDB、UltraEdit、DIV2K、LSDIR,以及 DALL·E 3 与 SDXL 生成图。去重后 7,321 个不同请求,覆盖 20 个攻击设置和五个场景 S1–S5。

    作者把 TAILOR 定位为在用户指定的稳健性、假阳性、画质和延迟约束下,联合选择片段、嵌入顺序、强度和几何恢复支持。

  3. 论文如何解决这个问题?

    离线响应曲线、SMT 选最低失真配置,再在用户图上现场校准。

    TAILOR 把一次部署请求 u=(Au, α, q, t) 变成一份配置:在 FPR 为 α、画质至少 q、延迟至多 t 的前提下,经受 Au 中的每一个攻击。三阶段为离线刻画、联合配置选择和现场校准(Figure 2)。片段库为 VINE、TrustMark、VideoSeal,全部携带同一 100-bit 载荷,经各自密钥派生的置换和符号掩码,因此组合提供的是同一身份的多条恢复路径。

    离线刻画

    • 测量:对每个片段 f 扫描原生嵌入强度 λf,在每个攻击 a 下记录平均比特准确率 bf(λf, a) 和逐图像分数;单独嵌入失真 Df(λf) 用 MSE;并记录嵌入与解码延迟。δg→f(λg, a) 是 g 嵌在 f 之后时 f 的恢复损失,efg 是超出单独项之和的成对超额失真。四个可选几何恢复阶段为 scale、tile、resynchronization 和 angle search。离线图像子集与现场校准图像不相交。
    • 连续强度:离散结点上的测量用分段线性模型外推到区间内任意强度,不外推到刻画范围之外,以便直接写入 SMT。
    • 预测量:配置 c 下,片段 f 的预测恢复是单独响应减去其后嵌入片段的交互项;若所选几何阶段作用于该片段和攻击,则改用对应几何响应。失真在 MSE 上相加并加上成对修正和几何项 Dφ(c)。因为 PSNR 随 MSE 单调下降,最小化 D(c) 等价于最大化 PSNR;请求的 PSNR 下限改写成等价的 MSE 上界。延迟 L(c) 为所选片段的嵌入、解码开销加上所选阶段开销。逐图像分数还用来判断是否达到图像级接受率。

    联合配置选择

    • 配置:c=(S, λ, π, φ)。S 为片段子集,λ 为原生强度,π 为嵌入顺序,φ 为启用的几何恢复,至多一个。搜索空间含 15 个有序非空子集、兼容的几何阶段,以及每个被选片段的连续强度。复合编码器按顺序嵌入。
    • FPR:一条配置可走单片段、融合和几何多条验证路径。零假设下对齐读出以 100-bit 随机匹配 X~Bin(100, 1/2) 为上界。总预算 α 分给 T(c) 次检验,阈值 τ(c, α) 取使单次尾概率不超过 α/T(c) 的最小匹配比例;联合界把配置级假阳性控制在 α 内。路径越多,恢复阈值越严。T(c) 由片段数和是否启用各类几何搜索决定。
    • 覆盖、画质与延迟:离线筛选使用保守裕度。均值准确率裕度 η 把阈值抬到 τ̄,接受率裕度 ηrate 把要求从 ρ 抬到 ρ̄。每个请求攻击至少被一个片段覆盖。论文给出 ρ=0.90,初始 ηrate∈{0.04, 0.06},初始 η=0.02。这些裕度只用于离线筛选;现场校准用原始 τ 和 ρ。同时要求预测 PSNR 不低于 q、预测延迟不超过 t,且每个被选片段至少覆盖一个请求攻击。
    • SMT:布尔变量编码片段选择、两两顺序、几何阶段和当前分段,实变量编码连续强度。从可行现任解出发,反复询问是否存在失真至少再低 ϵ 的可行解,直到不能再改进。求解器为 Z3。现任解连同片段、强度、顺序和几何阶段交给现场校准。

    现场校准与部署

    • 现场检验:在用户图像上跑完整编码、攻击、解码。Na 张图上,每个攻击 a 都要同时满足图像级接受率至少 ρ,以及平均比特准确率至少 τ(c, α);实测 PSNR 和延迟也须满足 q 和 t。
    • 请求局部修正:候选按预测失真从低到高测试,最多三个不同离散结构。若全部失败,用实测片段准确率和通过率替换该请求上的对应预测,求解器再给一个修订候选。若当前裕度下仍无候选通过,则按预先声明的日程改用更小裕度重试,请求、FPR 记账和现场判据不变。
    • 结果:第一个通过全部现场检查的候选为 cout,结果为 SAT,部署用同一阈值 τ(cout, α)。否则为 UNSAT。修正只写在该请求的数据库副本上,不改共享离线测量;对过于乐观的恢复做向下修正,并移动整条响应曲线而不是单点。
    • 验证分数:每个读出用对齐后的比特准确率。多片段时还可融合对齐的对数似然,个体、融合和几何读出共用同一统计量。
  4. 论文做了哪些实验?

    7,321 个请求上 TAILOR-F 场景平均满足率 96.21%,平均 PSNR 41.02 dB。

    实验设置

    • 被测方法:单位强度的 MaskWM、StegaStamp、VINE、TrustMark、VideoSeal;VINE + Geo. 与 TrustMark + Geo.;Enumeration 枚举全部七个非空子集、单位强度、固定顺序;Enumeration + Geo. 再评估几何恢复。TAILOR-G 贪心加入预测覆盖增益最大的片段且不回溯,但对每个子集仍用同一离线库和 SMT 重优化强度、顺序和几何阶段。TAILOR-F 为完整方法。所有方法共用同一批请求、现场图像和接受门。
    • 数据与请求:图像池来自 MS-COCO、DiffusionDB、UltraEdit、DIV2K、LSDIR,以及 DALL·E 3 和 SDXL 生成图。采样去重后 7,321 个不同请求、20 个攻击设置、五个场景:S1 信号处理与重编码(n=1,551)、S2 几何变换(n=1,532)、S3 再生与编辑(n=1,373)、S4 水印去除(n=822)、S5 广覆盖(n=2,043)。Figure 3 给出各场景中包含各攻击的请求数;一个请求可含多个攻击。离线测量用与现场校准不相交的固定子集。
    • 攻击名称:正文与 Figure 3、Figure 5 列出的包括 Brightness、Contrast、JPEG Q25、Gaussian blur、Gaussian noise、Crop 75%、Crop 50%、Rotation 9°、Crop + JPEG、Resize 256、Horizontal flip、Border-20、VAE-B、VAE-C、Regen、Rinse-2x、CtrlRegen+ 0.3、CtrlRegen+ 0.5、Image editing、UnMarker。具体参数以附录 C.2 与 Table 6 为准;正文未逐项给出全部算子参数。
    • 指标:请求满足率为通过现场验证、且满足该请求 FPR、画质和延迟的不同请求所占百分比;报告各场景满足率及其不加权平均。保真度在攻击前的原图与水印图上计算 PSNR 和 SSIM,只在该方法已接受的请求上取平均。PSNR-P 在双方都接受的请求上比较该方法与 TAILOR-F 的平均 PSNR。
    • 判定:现场门为每个请求攻击上的图像接受率 ρ=0.90 与均值恢复不低于配置相关阈值 τ(c, α),外加 PSNR 和延迟。论文未报告现场图像数 Na 的统一取值;Figure 13 的个案写明每个攻击 100 张图。论文未报告统计显著性检验,也未报告跨随机种子的重复次数。
    • 消融变体(Table 2):Single-fragment 仍做强度优化、几何阶段选择、候选搜索和现场验证,但每请求只用一个水印;Unit-strength 把所选强度固定为 1,保留子集、顺序、几何、候选搜索和现场修正;SMT-top1 与 SMT-top3 改变候选结构数量。Table 2 的 TAILOR-F 满足率为 95.50%,与 Table 1 的 96.21% 不是同一汇总口径,论文未说明二者差异来源。

    主结果

    Table 1 的请求满足率(%)与已接受请求上的 PSNR(dB)、SSIM。PSNR-P 为“该行方法 / TAILOR-F”。

    表格较宽,可左右滑动

    方法S1S2S3S4S5Avg.PSNRSSIM
    StegaStamp0.000.000.000.000.000.00--
    MaskWM10.320.000.000.000.002.0638.510.9774
    VINE8.830.0042.6854.260.0021.1535.010.9931
    TrustMark100.000.0023.380.000.0024.6840.910.9909
    VideoSeal27.9849.744.010.002.7416.8945.160.9949
    Enumeration + Geo.100.00100.0088.7863.9963.2983.2137.380.9874
    TAILOR-G100.0097.3987.5576.0394.2791.0540.910.9914
    TAILOR-F100.00100.0097.3185.4098.3496.2141.020.9923

    表中省略了 VINE + Geo.(Avg. 22.83,PSNR 34.87)、TrustMark + Geo.(Avg. 46.01,PSNR 40.08)和 Enumeration(Avg. 76.27,PSNR 38.49),数字均在 Table 1。StegaStamp 的 PSNR、SSIM 在表中为 “-”;Figure 4 图注写 StegaStamp: PSNR N/A (0%)。TAILOR-F 的 PSNR-P 格为 “-”。

    • 满足率:作者称 TAILOR 场景平均 96.21%,比贪心高 5.16 个百分点,比 Enumeration + Geo. 高 13.00 个百分点。S1 与 S2 为 100%,S3 为 97.31%,S5 为 98.34%,S4 为 85.40%。作者称 S4 更难。作者称 Figure 5 里按攻击归组的各组中,TAILOR 的满足率都是所比较方法中最高的;图中可见的文字包括若干攻击名和 100%、60%、20% 刻度,具体柱高无法从文本读出。
    • 保真度:作者称 TAILOR 平均 PSNR 41.02 dB、SSIM 0.9923。VideoSeal 单独 PSNR 为 45.16 dB,作者解释为它只嵌一个水印、接受的请求集更窄,因此各方法的平均 PSNR 不能直接比较。作者称在共同接受的请求上,所有已完成比较中 TAILOR 的 PSNR 都更高,其中包括相对 VideoSeal 的 0.79 dB;Table 1 的 PSNR-P 列给出 VideoSeal 为 45.16 / 45.96,TrustMark 为 40.91 / 43.55,VINE 为 35.01 / 40.26。
    • 片段互补:作者用 Table 1 说明 TrustMark 在 S1 最强(100%),VideoSeal 在 S2 最强(49.74%),VINE 在 S3、S4 覆盖更高(42.68% 与 54.26%)。直接叠加实验中,组合后平均原始比特准确率只下降 0.49 个百分点,且在合适顺序下各片段读出仍高于验证阈值。去掉显式交互修正后,请求满足率只变化 0.09 个百分点(附录 D.3、D.4)。成对超额失真:TrustMark–VideoSeal 与 VINE–VideoSeal 在测量范围内为 0,TrustMark–VINE 至多 0.35 MSE,单独失真为 1–21 MSE;三片段顺序下失真模型与实测 PSNR 之差至多 0.09 dB(混合强度)和 0.31 dB(接近最大强度)。

    候选搜索与组成消融

    Table 2 报告满足率、PSNR、SSIM,以及相对 TAILOR-F 的 PSNR-P。

    • 候选数量:SMT-top1 满足 80.65%,最多三个候选结构升至 91.99%(+11.34 个百分点);请求局部修正和裕度回退再升至 TAILOR-F 的 95.50%(再 +3.51 个百分点)。作者称排序最高的离线候选并不总是够用。在共同接受的请求上,SMT-top1 与 SMT-top3 和 TAILOR 选出相同配置,交集上的平均 PSNR 分别为 41.22 dB 与 40.83 dB。
    • 是否组合:Single-fragment 满足 63.64%,TAILOR 为 95.50%,差 31.86 个百分点。共同接受请求上 TAILOR 为 42.20 dB,Single-fragment 为 41.84 dB。作者称单个优化后的水印不足以应付异构攻击请求。
    • 强度:Unit-strength 满足 73.18%,TAILOR 为 95.50%。共同接受请求上 TAILOR 为 41.40 dB,Unit-strength 为 37.92 dB,作者称相差 3.48 dB。

    个案中的现场数字

    Figure 12、Figure 13 是个案,不是全基准汇总。Figure 13 的 S5 请求含 15 个攻击,FPR≤2^−37,PSNR≥33 dB,延迟≤16 s;解为 TrustMark λ=0.70、VINE λ=0.75、VideoSeal λ=1.12,几何恢复为 Scale Search,接受阈值 86/100 bits。现场写明每攻击 100 张图:多数攻击通过率 100,Rotation 99,Border Shift 92,InstructPix2Pix 97;15/15 攻击通过,PSNR 33.63 dB,延迟 393 ms,FPR 5.7×10^−12。Figure 12 的文字可见 S3、Latency≤1 s、FPR≤10^−6 与 8.5×10^−7、90% Gate,其余柱值无法从文本读出。

    其他消融与分析

    • 附录 D 还有更多消融;正文只定量写出 D.3 的 0.49 个百分点和 D.4 的 0.09 个百分点。
    • 筛选参数:ρ=0.90,初始 η=0.02,初始 ηrate∈{0.04, 0.06};修正中 σ0=0.023(各图像来源、每来源 30 张图的单元均值变异的第 90 百分位),向下平移的二分区间为 [−0.4, 0]。
    • 几何恢复至多启用一个;验证次数 T(c) 随 resync、scale、tile、angle 增加固定的候选视角数(附录 A.3 的公式)。
    • StegaStamp 五场景满足率均为 0.00%;VINE 与 VINE+Geo. 在 S2、S5 为 0.00%,TrustMark 在 S2、S4、S5 为 0.00%。
    • 作者称离线预测在未见图像上可能偏乐观,因此筛选用裕度,部署以现场检查为准;若无候选通过则为 UNSAT。论文未在 Table 1 给出 UNSAT 的分项原因。
    • PSNR-P 只在双方都接受的请求上比较;TAILOR-F 一行的 PSNR-P 为空。
  5. 有什么可以进一步探索的点?

    配置只认证请求点名的算子;结论未单列局限清单。

    作者指出的局限与后续方向

    论文没有单独的 Limitations 或 Future Work 小节。下面只收录正文里明确写成边界或未覆盖做法的句子。

    • 认证范围:Section 3 写明,Au 是规格,TAILOR 返回的配置只针对这些算子、且只针对请求所点名的设置被认定,Table 6 列出这些设置。攻击者只被授予 Au 所需能力;除非某攻击本身定义为多个操作的组合,否则攻击分开评测。
    • 搜索预算内的失败:Section 4.2 与 Section 4.3 写明,求解器在编码模型和候选预算内找不到可行配置时返回无配置;现场侧若没有候选通过全部检查,结果为 UNSAT。
    • 离线测量不外推:附录 A.1 写明,求解器可以在已测量强度之间插值,但不超出刻画范围外推。
    • 与已有工作的范围差:Section 2 称,据作者所知,已有工作没有把部署直接当成对异构片段、顺序、强度和恢复机制的逐请求约束优化。这是作者对文献范围的判断,不是实验失败。
    • 结论中的定位:Section 6 称,这项工作为把水印组合适配到不同应用的溯源和归属需求提供一个基础。作者没有在该节列出具体的下一步实验。

    伦理声明、受控环境或向厂商披露一类表述,正文转换文本中没有对应段落,这里不补写。

    实验覆盖范围

    • 请求规模:去重后 7,321 个不同请求,五个场景的请求数为 S1 1,551、S2 1,532、S3 1,373、S4 822、S5 2,043(Figure 3),共 20 个攻击设置(Section 5.1)。
    • 片段与基线:组合库为 VINE、TrustMark、VideoSeal,同一 100-bit 字;基线还包括单位强度的 MaskWM 与 StegaStamp,以及 Geo.、Enumeration、Enumeration + Geo. 和 TAILOR-G(Section 5.1、附录 A.6)。
    • 图像来源:MS-COCO、DiffusionDB、UltraEdit、DIV2K、LSDIR,以及 DALL·E 3 与 SDXL 生成图;离线子集与现场图像不相交(Section 4.1、Section 5.1)。
    • 现场与消融口径:Table 1 的 TAILOR-F 场景平均满足率为 96.21%、平均 PSNR 41.02 dB;Table 2 的 TAILOR-F 满足率为 95.50%、PSNR 40.66 dB。候选搜索至多三个离散结构,失败后用请求局部模型再解一次(Section 4.3)。论文未报告统一的 Na、重复次数,以及满足率差异是否做过显著性检验。
    • 几何与 FPR:几何阶段为 scale、tile、resynchronization、angle search,至多启用一个;FPR 用 100-bit 二项尾和联合界,路径越多阈值越严(Section 4.2、附录 A.3)。ρ=0.90。
  6. 总结一下论文的主要内容

    TAILOR 用 SMT 和现场校准按请求组合三种水印,场景平均满足率 96.21%。

    TAILOR 是一个按部署请求组合已有图像水印的框架,用来在指定攻击、FPR、画质下限和延迟上限下选出一份配置。

    • 问题:保护者在图像生成之后嵌入水印,验证不需要原图。攻击者只有带水印图像,没有密钥和原图,并只使用该请求点名的攻击。单一水印覆盖的变换不同,叠在一起又要共享失真、延迟和 FPR。
    • 方法:离线测量 VINE、TrustMark、VideoSeal 的恢复、MSE 失真、时延和四种几何恢复,建成随强度变化的分段线性曲线。SMT(Z3)在离散结构与连续强度上最小化预测失真。现场校准在用户图像上检查每个攻击的图像接受率(ρ=0.90)和均值恢复,最多试三个结构,失败则向下修正预测后再解一次。三个片段携带同一个 100-bit 身份。
    • 主结果:7,321 个请求上,TAILOR-F 的场景平均满足率为 96.21%,平均 PSNR 41.02 dB,SSIM 0.9923(Table 1)。S1 与 S2 为 100%,S3 为 97.31%,S5 为 98.34%,S4 为 85.40%。作者称这比 TAILOR-G 高 5.16 个百分点,比 Enumeration + Geo. 高 13.00 个百分点。
    • 对照:在共同接受的请求上,作者称 TAILOR 的 PSNR 高于每个已完成比较的基线,其中包括相对 VideoSeal 的 0.79 dB;VideoSeal 自己的平均 PSNR 为 45.16 dB,但接受的请求更少。Table 2 中,单片段 63.64%,单位强度 73.18%,SMT-top1 80.65%,SMT-top3 91.99%,该表中的 TAILOR-F 为 95.50%。
    • 作者的结论:作者认为互补片段加上联合选强度、顺序和几何恢复,能比固定的单水印和单位强度枚举更好地同时满足稳健性与画质;返回的配置只对请求中的算子和设置负责,找不到则报告 UNSAT。作者称这项工作为按应用需求适配水印组合提供了基础。
阅读原文arxiv.org