跳到正文
10月9日 · 周五

隐私与数据泄露 · 论文

找到 43 篇

另有 57 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2605.19847

    论文揭示多租户 RAG 账号合谋使隐私泄露随账号数线性增长

    提出零知识审计协议,核验多租户 RAG 的合谋差分隐私

    发表
    测试
    MultiTenantRAGService、FAISS、HNSW (M=64, efcstr=200, efq=128) 等 4 个
    摘要揭示多租户 RAG 合谋泄露按根号 k 放大,提出带零知识证明的无泄露审计协议。

    论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。

    深度解读完整解读
  2. 分析与理论arXiv 2610.04860

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    分析文本水印在 RAG 中诱发事实幻觉的机制并提出干预

    发表
    测试
    LLaMA 3.1 8B Instruct、Mistral-7B-Instruct-v0.3、Qwen2.5-14B-Instruct
    摘要论文揭示了生产环境文本水印导致模型事实退化的失效模式,分析了解码机制并提出针对性干预。

    论文研究生产级文本水印对大语言模型事实准确性的影响,分析了水印诱发幻觉的失效模式并评估了针对性缓解方案。

    深度解读完整解读
  3. 防御arXiv 2610.05870

    MBZUAI 提出可校准的真实图像认证方法

    提出校准重合成方法,以生成器反演保真度认证真实图像并防御对抗扰动

    发表
    攻击者
    白盒
    测试
    SD2.1、SD3、SD3.5 等 10 个

    摘要论文提出基于反演保真度与阈值校准的健全认证框架,在对抗扰动下维持错误率界限,并指出真实内容可认证性随生成器演进而萎缩。

    深度解读完整解读
  4. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件

    发表
    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  5. 其他arXiv 2609.14843

    研究分析 3930 条 Reddit 帖子,揭示青少年对陪伴型 AI 聊天机器人的过度依赖

    主题分析青少年相关 Reddit 帖子,归纳陪伴 AI 过度依赖与感知互惠

    发表
    测试
    Character.AI、Replika、ChatGPT 等 4 个
    摘要陪伴关系由即时回应、共同过去和可识别他人叠加而成,安全要管记忆、边界和退出。

    Namvarpour、Chang 与 Razi 用计算辅助主题分析,描述青少年相关 Reddit 讨论中与 AI 陪伴聊天机器人的关系及潜在过度依赖。

    深度解读完整解读
  6. 评测与基准arXiv 2608.20554

    aiXamine:跨维度评测 LLM 安全、安全(security)与隐私权衡

    提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡

    发表
    测试
    openai/gpt-5-mini、openai/gpt-4o、anthropic/claude-haiku-4.5 等 15 个
    摘要aiXamine 用九服务黑盒协议比较百余个模型,作者称单轴信任度进展可能削弱其他轴。

    aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。

    深度解读完整解读
  7. 分析与理论arXiv 2607.12649

    研究者提出可提取记忆的匹配比较检验方法

    提出匹配比较校准,界定生成训练序列何时算可抽取记忆

    发表
    测试
    OLMo 2 32B base、OLMo 2 32B Instruct、OLMo 2 7B 等 7 个
    摘要匹配非成员校准阈值后,短序列抽取含大量假阳性,极低概率过阈值也不等于可抽取。

    Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。

    深度解读完整解读
  8. 防御arXiv 2609.10992

    拆解 LLM 交互中的隐私-效用权衡:Veilmind-4B 意图驱动本地保护框架

    提出意图驱动本地框架 Veilmind,净化发往远程模型的提示词

    发表
    测试
    Veilmind-4B、Qwen3-4B、DeepSeek-V4-Flash 等 4 个
    摘要本地模型按意图净化提示词,在 Uprise 上给出两个隐私-效用工作点。

    本地侧的意图驱动净化,用来降低用户提示词发往不受信任远程模型时的敏感属性暴露。

    深度解读完整解读
  9. 攻击arXiv 2609.12448

    GraphProfiler 用个人知识图谱推断敏感属性并溯源到具体帖子

    提出 GraphProfiler,用个人知识图谱从帖子历史推断敏感属性并溯源

    发表
    测试
    Azure OpenAI GPT-4o
    摘要GraphProfiler 用源链接个人知识图谱做属性推断,准确率接近文本基线,并把证据定位到少量源帖。

    GraphProfiler 是一个可审计的 LLM 敏感属性画像器:用源链接个人知识图谱,把推断落到具体帖子。

    深度解读完整解读