跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 2 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 防御arXiv:2610.05870 ·

    MBZUAI 提出可校准的真实图像认证方法,20 个深伪检测器在对抗扰动下全部跌破 2% 准确率

    提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书

    测试
    SD2.1、SD3、SD3.5 等 10 个模型层
    场景
    模型与 API攻击者白盒
    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。
    • 研究定位:论文提出了基于生成模型反演保真度与阈值校准的健全内容认证框架(Calibrated Resynthesis),将传统的真伪二分类检测转变为具备量化错误率保证的真实性单边认证与证据化弃权机制。
    • 核心问题:随着生成模型能力增强,传统二分类检测器的准确率随时间推移从 99.5% 衰减至 76% 且极易被对抗微扰攻破;同时生成模型的记忆与重现能力导致内容本身出现来源二义性,难以做出不偏向假阳性的真伪判别。
    • 方法要点:通过已知生成器对输入样本进行反演,融合像素、结构、感知与语义四个维度计算真实性指数 A-index;若任一生成器能保真重构则选择弃权并返回重构图像作为证据,仅在所有已知生成器均重构失败且超过校准阈值时出具真实性证书;同时离线校准面向普通用户的安全阈值与面向 PGD 扰动的防御阈值(均控制 1% FPR)。
    • 核心实验结果:在 ϵ = 8/255 的 PGD 对抗攻击下,20 个基线检测器准确率全部跌破 2%(其中 12 个归零),而校准阈值保持 1% FPR 边界(Table I);中等算力攻击者进行 100 次候选搜索结合 PGD 优化后的最高得分仅为 0.0154,仍处于安全阈值 0.0365 之下(Figure 8);在 24 种常见图像变换中有 23 种生成样本得分低于安全阈值(Table XII)。
    • 真实性空间侵蚀发现:在 3,000 张 Reddit 网络图像测试中,2022 年生成器阈值下有 1,116 张图像可被认证,而 2024 年生成器阈值下仅能认证 55 至 79 张,可认证内容集合缩减超过 14 倍(Figure 9)。
    • 作者结论与启示:作者认为依赖内容本身的二分类判别无法解决生成器重现带来的二义性,检测评估应以固定 FPR 下的召回率为准;随着生成模型日益强大,人类事后能够认证为真实的内容空间正在不可逆地缩小,而重合成校准提供了一种追踪此演进过程的度量工具。
    完整解读
  2. 评测与基准arXiv:2609.08258 ·

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个应用层
    场景
    AI Agent
    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。
    • 研究定位:该研究首次系统性实证评估了多款主流大语言模型智能体记忆框架在软撤回机制下的运行时安全边界与撤回执行有效性。
    • 核心问题:现代记忆系统普遍采用将陈旧知识标记为无效而非物理删除的软撤回设计,但默认检索机制是否会在读取时拦截失效记录、避免智能体依据作废策略采取危险操作,此前未有深入验证。
    • 评测与防御设计:研究在直接与间接两种插入模式下向 5 款记忆系统写入作废与替代策略,跨越 9 个模型评估其检索暴露与不安全决策表现;针对系统未默认过滤的现状,提出了在检索返回路径进行元数据校验与成对冲突检测的 Stale-Retrieval Guard 组件。
    • 主要实验发现:直接写入且无防御时,两款暴露系统(Graphiti与mem0 exp.)将作废记录全部返回且排在首位,导致智能体平均在 43.1%(699/1,620)的试验中执行不安全行动(Table 6);即使提示词明确禁止危险操作,模型不安全率仍有 12.9%(Table 8);存储级过滤虽能在单次交互中将不安全率归零,但在智能体将决策回写记忆库后,3 跳内的不安全率迅速反弹至 83.1%(Table 14)。
    • 作者结论与启示:作者指出记忆系统的安全盲区并非源于外部投毒或数据来源伪造,而是内部合规生命周期中缺乏检索时有效性校验;仅依赖写入来源证明或模型提示词无法抵御作废策略,必须在读取管道上强制实施严格的陈旧记录过滤。
    完整解读
已经到底了