跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

找到 6 篇

另有 112 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    揭示检索生成中文本水印诱发事实幻觉的机制并提出 FPTI 与 FPAI 干预

    发表
    测试
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  2. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成认证,仅当已知生成器都不能保真重构时签发真实图像证书

    发表
    攻击者
    白盒
    测试
    SD2.1、SD3、SD3.5 等 10 个

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  3. 防御arXiv 2609.08258

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测智能体记忆软撤回是否生效,并提出陈旧检索防护

    发表
    场景
    AI Agent
    测试
    GPT-5.5、Grok-4、DeepSeek-V4-Flash 等 9 个

    摘要系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    深度解读完整解读
  4. 防御arXiv 2609.14003

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    提出 FLOWSEAL,在工具边界以信息流控制阻断智能体隐私泄露

    发表
    场景
    AI Agent
    测试
    DeepSeek-V3.2、DeepSeek-R1、GPT-4.1-mini 等 4 个

    摘要作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御 FLOWSEAL 并验证有效性。

    深度解读完整解读
  5. 防御arXiv 2609.12378

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    提出端到端全同态加密方案 ODIN,在云端密文上完成推理以保护提示词

    发表
    测试
    Meta-Llama-3-8B、Llama-3-8B(THOR-style baseline)
    摘要ODIN 用可复用的特征主序打包和联合误差预算,在单张 H100 上完成 Llama-3-8B 的 CKKS 推理。

    ODIN 是面向 Llama 的服务器侧 CKKS 推理系统:客户加密提示词,诚实但好奇的服务器用明文权重在密文上算完 Llama-3,只返回结果密文。

    深度解读完整解读
已经到底了