跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 防御arXiv:2610.05870 ·

    MBZUAI 提出可校准的真实图像认证方法,20 个深伪检测器在对抗扰动下全部跌破 2% 准确率

    提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书

    测试
    SD2.1、SD3、SD3.5 等 10 个模型层
    场景
    模型与 API攻击者白盒
    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
    • 研究定位:论文提出了基于生成模型反演保真度与阈值校准的健全内容认证框架(Calibrated Resynthesis),将传统的真伪二分类检测转变为具备量化错误率保证的真实性单边认证与证据化弃权机制。
    • 核心问题:随着生成模型能力增强,传统二分类检测器的准确率随时间推移从 99.5% 衰减至 76% 且极易被对抗微扰攻破;同时生成模型的记忆与重现能力导致内容本身出现来源二义性,难以做出不偏向假阳性的真伪判别。
    • 方法要点:通过已知生成器对输入样本进行反演,融合像素、结构、感知与语义四个维度计算真实性指数 A-index;若任一生成器能保真重构则选择弃权并返回重构图像作为证据,仅在所有已知生成器均重构失败且超过校准阈值时出具真实性证书;同时离线校准面向普通用户的安全阈值与面向 PGD 扰动的防御阈值(均控制 1% FPR)。
    • 核心实验结果:在 ϵ = 8/255 的 PGD 对抗攻击下,20 个基线检测器准确率全部跌破 2%(其中 12 个归零),而校准阈值保持 1% FPR 边界(Table I);中等算力攻击者进行 100 次候选搜索结合 PGD 优化后的最高得分仅为 0.0154,仍处于安全阈值 0.0365 之下(Figure 8);在 24 种常见图像变换中有 23 种生成样本得分低于安全阈值(Table XII)。
    • 真实性空间侵蚀发现:在 3,000 张 Reddit 网络图像测试中,2022 年生成器阈值下有 1,116 张图像可被认证,而 2024 年生成器阈值下仅能认证 55 至 79 张,可认证内容集合缩减超过 14 倍(Figure 9)。
    • 作者结论与启示:作者认为依赖内容本身的二分类判别无法解决生成器重现带来的二义性,检测评估应以固定 FPR 下的召回率为准;随着生成模型日益强大,人类事后能够认证为真实的内容空间正在不可逆地缩小,而重合成校准提供了一种追踪此演进过程的度量工具。
    完整解读
已经到底了