跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

精选论文 26 篇
  1. 防御arXiv:2610.05870 · 53

    MBZUAI 提出可校准的真实图像认证方法,20 个深伪检测器在对抗扰动下全部跌破 2% 准确率

    研究者提出基于生成器反演保真度与阈值校准的真实图像认证方法,在1% FPR下能防御 ϵ=8/255 的PGD扰动。

    • 1.75%D3在ϵ=8/255的PGD攻击下的后验准确率(Table I)
    • 0.00%OmniAID等12个基线在ϵ=8/255攻击下的后验准确率(Table I)
    • 0.0154SD3 Medium下100次采样加PGD优化后的最高A-index(第V-B节)
    6 问速览针对生成器演进导致检测准确率下降及对抗脆弱性,论文提出通过反演保真度与阈值校准对真实内容进行健全认证。
    1. 这篇论文试图解决什么问题?

      针对生成器演进导致检测准确率下降及对抗脆弱性,论文提出通过反演保真度与阈值校准对真实内容进行健全认证。

    2. 有哪些相关研究?

      论文讨论了主动水印与元数据、被动特征与重构检测器、视频时序检测以及扩散反演技术,并明确了本文与基线的区别。

    3. 论文如何解决这个问题?

      论文通过整流流动反演计算四维融合真实性指数,并依据生成样本及攻击样本离线校准安全与防御双阈值进行认证或弃权。

    4. 论文做了哪些实验?

      实验显示基线检测器在PGD攻击下准确率跌破2%,而校准阈值保持1% FPR;Reddit图像可认证比例随生成器演进下降超14倍。

    5. 有什么可以进一步探索的点?

      作者指出反演计算开销高、无法覆盖黑盒模型与私有微调、防御阈值仅限已知攻击类别,以及视频未建模时序动态等局限。

    6. 总结一下论文的主要内容

      论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    完整解读
  2. 防御arXiv:2609.14003 · 56

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    作者针对智能体隐私泄漏提出FLOWSEAL防御,在SPR基准上将CWL攻击的条目泄漏率从52.2%降至0.5%。

    • 0.5%DeepSeek-V3.2下SPR基准CWL攻击FLOWSEAL的LRI
    • 52.2%DeepSeek-V3.2下SPR基准CWL攻击SPR-D2的LRI
    • 2.3%DeepSeek-V3.2下SPR基准SOA攻击FLOWSEAL的LRI
    6 问速览解决现有提示词防御在对手控制的上下文中做隐私判定导致机制与攻击面重合的问题。
    1. 这篇论文试图解决什么问题?

      解决现有提示词防御在对手控制的上下文中做隐私判定导致机制与攻击面重合的问题。

    2. 有哪些相关研究?

      梳理智能体隐私基准、基于模型的隐私防御及信息流控制,指出本文将强制执行移至上下文外。

    3. 论文如何解决这个问题?

      FLOWSEAL在工具边界设立代码拦截器,结合数据溯源、三级格策略与独立内容检查实现信息流控制。

    4. 论文做了哪些实验?

      在三项基准、多种模型与真实MCP测试中,FLOWSEAL将新型攻击泄漏率压至2.3%以下并保持72.4%实用率。

    5. 有什么可以进一步探索的点?

      作者指出检查器存在改写漏检与误拒局限,未登记数据存在盲区,未来可探索系统层多层防御。

    6. 总结一下论文的主要内容

      作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。

    完整解读
已经到底了