跳到正文

#隐私/数据泄露

今天还没有收录新动态
10月1日周四
  1. arXiv:后门、投毒与隐私 ·

    Unmerge:用任务算术实现高效机器遗忘

    Unmerge 将机器遗忘重构为任务算术的逆运算:微调得到的合并任务向量减去低秩遗忘分量即可恢复保留任务向量,因为遗忘激活在每层都集中在少数主方向构成的子空间内。在 CIFAR-100 和 Tiny ImageNet 上对 ResNet-50 做类别级遗忘时,其 Tug-of-War 指标比同等运行时间的基线最高提升约 24%,比运行慢约 5 倍的更强基线最高提升约 18%,成员推断暴露维持在重训练水平。该方法同样适用于 ViT-S/16,并可扩展到 Llama-3.2-3B,其逐层基几何还可作为判断遗忘何时何地结构性困难的诊断工具。

  2. arXiv:越狱与提示注入 ·

    推理层安全:防御对抗性推理与基础设施滥用

    论文研究 LLM 服务在推理层面临的对抗性交互,包括越狱、拒绝服务与知识蒸馏攻击,并以假设的前沿实验室 Five Elements Inc. 为例展开。由于缺少公开的对抗性 LLM 使用标注数据集,作者提出结构因果模型(SCM)生成带标签的用户会话数据集,包含协同多账号活动、平台反馈和三个层级的标签可观测性。在该数据集上训练的梯度提升检测器对 oracle 标签的二元分类 AUPRC 达 0.993,但面对真实 Trust & Safety 团队持有的运营标签时 AUPRC 仅 0.313,说明检测器比用于评估它的标签更准确。攻击类型归因方面,朴素 argmax 受 98% 良性先验主导,macro-F1 仅 0.295,改用简单阈值决策引擎后提升到 0.489 且不损失准确率。数据集已公开。

9月29日周二
  1. arXiv:对齐与欺骗 ·

    TTMark:超越单 token 熵的成对无失真水印

    TTMark(Tandem Token WaterMark)将无失真水印从单个 token 扩展到相邻 token 对,通过对连续 token 的联合分布加水印,把有效水印字母表从 V 扩大到 V²,使检测器能同时利用 token 熵与条件熵。该方法引入分支隔离的串联生成算法,可在单次前向传播中构建联合分布,理论上在低熵场景下具有更强的期望检测强度。在多个语言模型、数据集和三种代表性无失真水印方案上的实验显示,TTMark 在不降低生成质量的前提下持续提升可检测性,并改善抗编辑鲁棒性与局部水印检测能力。

9月28日周一
  1. arXiv:后门、投毒与隐私 ·

    物理认证联邦学习:为关键水务基础设施的协同异常检测提供安全保障

    研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。

  2. arXiv:后门、投毒与隐私 ·

    机器遗忘在 ASR 中是否有效:arXiv 论文评估现有算法与评测工具

    一项提交至 ICASSP 2027 的研究评估了现有机器遗忘(MU)算法与评测工具是否适用于自动语音识别(ASR),发现基于梯度上升的算法能在隐私与效用间取得较好权衡,而更复杂的方法会过度遗忘样本、反而更容易被识别为已遗忘。研究指出,基于简单成员推理攻击的标准隐私评估不足以可靠判断遗忘是否成功,且顺序遗忘与同时遗忘的隐私和效用均差于单主体遗忘。

9月25日周五
  1. arXiv:对齐与欺骗 ·

    DwT-FL:联邦学习中边训练边去重的隐私保护跨客户端去重系统

    针对联邦学习中跨客户端重复数据降低训练效率并加剧模型记忆与隐私风险的问题,研究者提出“边训练边去重(DwT)”范式及隐私保护去重系统 DwT-FL,将跨客户端去重从一次性全局同步预处理转为带状态管理、并发声明与故障恢复的持续在线服务。该系统通过并发状态声明机制与冷热双队列调度策略,实现安全去重与模型训练的并行执行,并支持客户端动态加入。实验显示,相比 SOTA 方案,DwT-FL 将故障恢复和动态加入的时间开销分别最多降低 93.04% 和 94.18%。

9月24日周四
9月23日周三
  1. arXiv:可解释性 ·

    GUARD:在 CosyVoice2 上做说话人身份遗忘以阻止重识别

    研究提出 GUARD,一个轻量级说话人身份遗忘框架,在冻结的 TTS 主干上结合学习到的说话人门控与说话人无关的激活引导,引导向量用组相对奖励优化,把遗忘说话人的输出推向群体层面的冒充者相似度,同时保持可懂度与语音自然度。在 CosyVoice2 上,GUARD 将遗忘说话人相似度从 0.541 降到 0.103,在 150 名说话人库中的重识别准确率从 73.5% 降到 0.5%,并保留了对保留说话人的复现能力。作者指出,仅看相似度下降不足以刻画说话人身份遗忘是否成功,重识别应作为补充评估标准。

9月20日周日
  1. arXiv:对齐与欺骗 ·

    VidMark:面向视频生成模型知识产权保护的高效水印方案

    研究者提出一种生成内嵌水印方案,用于视频生成模型(VGM)的合成视频验证与模型所有权验证两项取证任务。方案包含名为 VidMark 的视频水印网络,结合两级离散小波变换(DWT)分解与全局时序注意力模块(GTAB),并通过解码器引导的微调让 VGM 生成携带模型专属水印的视频。在代表性 VGM 上实验显示,水印提取准确率超过 99%,两项验证任务准确率均达 100%,且对视频级与模型级攻击具有强鲁棒性。

9月18日周五
  1. arXiv:越狱与提示注入 ·

    HE-Guardrail:面向加密大模型推理的同态护栏防御越狱攻击

    作者指出,基于同态加密的大语言模型推理存在一个安全漏洞:服务端在无法接触明文的情况下,既看不到客户端提交的提示词,也看不到模型生成的回复,因此恶意客户端的越狱攻击难以被检测或拦截,甚至可能完全不被服务端察觉。为此作者提出 HE-Guardrail 框架,在加密数据上完整执行护栏机制,并以同态方式控制目标模型的回复是否返回给客户端。该框架以 Llama Guard、JBShield 和 GradSafe 三种代表性护栏进行实例化,结果显示其在密文域中能较接近地复现对应明文护栏的判定,并在安全性、效率与可用性之间呈现不同的权衡。

  2. arXiv:越狱与提示注入 ·

    用扩散模型隐空间扰动防御视觉语言模型的地理位置隐私泄露

    研究系统考察了多模态大推理模型(MLRM)从日常照片推断用户地理位置带来的隐私泄露,发现基于拒答的防护严重不足,精心构造的越狱提示词可将模型响应率提高到 100%。作者指出,现有在像素空间注入不可见扰动的防御受结构性限制,黑盒迁移性下降且出现明显视觉伪影。为此提出一种基于扩散模型的主动防御框架,在反向采样过程中向扩散模型隐空间注入扰动,直接作用于高层语义表示,并以与 GPS 坐标对齐的 GeoCLIP 作为代理模型定位和破坏 MLRM 用于位置推断的地理信号。该方法在保持图像感知质量的同时获得更强的黑盒迁移性,便于在社交媒体平台集成。该工作已被 NDSS 2027 接收。

9月17日周四
  1. arXiv ·

    面向旧款 GPU 的可验证差分隐私训练框架:用 CPU 侧 TEE 校验 GPU 梯度

    论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。

9月15日周二
  1. arXiv:对齐与欺骗 ·

    ROSETTA:基于混合 CKKS/TFHE 的高效准确隐私保护 LLM 解码框架

    ROSETTA 是一个混合 CKKS/TFHE 框架,用于解决全同态加密(FHE)隐私推理中非线性操作开销过大的问题。它提出基于 TFHE 的自适应分段查找表协议,并设计算子选择框架自动将每个非线性算子分配给 CKKS 或 TFHE,以最小化端到端解码延迟。相比 SOTA 框架 CacheMir,ROSETTA 实现最高 4.8 倍 Softmax 加速和 1.5–2.1 倍端到端加速,论文已被 ACM CCS 2026 接收。

9月14日周一
  1. arXiv:后门、投毒与隐私 ·

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。

9月12日周六
  1. arXiv:越狱与提示注入 · · 原文 80

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    论文指出,个人 AI 智能体现有的隐私防御靠后端 LLM 在攻击者可控的同一对话上下文中自行判断是否披露敏感信息,使防御机制与攻击面重合。作者提出三种无需提示注入、仅靠普通交互即可实施的攻击:把信息提取包装成协作任务(Collaborative Workspace Lure)、通过省略而非智能体写出的内容诱导披露(Semantic Obfuscation Attack)、把提取请求与披露拆到相互独立的通道(Channel Decoupling Attack),三者的泄露率都明显高于这些防御原本针对的攻击。据此作者提出 FLOWSEAL,在 LLM 上下文之外的工具层拦截器中,依据数据来源和带受控降密的信息流控制格执行保密。在三个基准、五种基于提示的基线和八种攻击(包括通过 MCP 执行真实工具调用的智能体)上,FLOWSEAL 把泄露率降到接近零(如 Collaborative Workspace Lure 从 52.2% 降到 0.5%),同时保持任务效用,且不依赖底层 LLM。

    推荐理由论文给出三种无需提示注入即可绕过现有隐私防御的交互式攻击,并附各防御下的泄露率对比,便于评估 Agent 隐私防护的实际边界。

9月11日周五
  1. arXiv:后门、投毒与隐私 ·

    基于 Hessian 分析的相关性引导快速机器遗忘

    一种面向网络与分布式安全系统的机器遗忘框架通过识别训练集中的相关数据点并应用闭式参数更新规则,相比标准影响函数遗忘实现 82 倍墙钟加速,准确率较 SOTA 基线提升 10^-2。该方法借助 Hessian 阻尼保证数值稳定性,在包括 CIFAR-100 与 ResNet-50 在内的七种数据集-架构组合上评估,成员推理攻击成功率为 0.660,tug-of-war 得分为 0.950。

  2. arXiv:对齐与欺骗 ·

    Odin:面向隐私保护 Llama 3 8B 推理的开源端到端 FHE 实现

    Odin 是首个开源的端到端 GPU CKKS 实现,可在加密状态下完成 Llama-3-8B 推理。它通过 feature-major 跨层布局统一残差连接与层接口,并为线性投影和注意力构建临时算子内布局,减少权重的冗余明文编码;注意力中 QK^T 的分数可直接被 Softmax 消费,PV 直接消费概率,避免中间重打包;非线性运算采用带输入范围控制的 minimax 多项式近似与联合误差分配。在单张 NVIDIA H100 80 GB GPU 上,输入 128 token 时评估全部 32 层耗时 366.4 s、峰值显存 58.9 GiB,相比 THOR 的 1651.9 s 提速 4.51 倍。

9月9日周三
  1. arXiv:越狱与提示注入 ·

    AIOS 的内核管理共享内存:面向系统级个性化的新抽象

    研究提出"内核管理共享内存",由智能体系统内核而非单个智能体统一负责记忆检索、隐私执行与提示注入。该设计在 AIOS 上实现,用 GPT-4o、Llama-3.1:8B、Qwen-2.5:7B 三个助手模型共 1800 次试验,对比 Mem0 等三种方案:个性化得分提升 2.4-4.0 分(5 分制,GPT-4o 上 profile usage 从 1.05 升至 4.69),端到端延迟降低 15-61%,并减少每次调用的 token 用量与推理成本。

  2. arXiv:对齐与欺骗 ·

    面向联邦 LLM 微调的隐私保护拆分学习

    针对联邦拆分学习中 LLM 自回归特性导致中间激活泄露输入、现有扰动防御失效的问题,研究者提出一种可学习的混淆—恢复方案,在保护参与者私有数据集的同时仍能在服务器端训练可独立部署的模型。实验显示该方法在实现强隐私保护的同时仅带来适度的效用损失和系统开销,使基于拆分的联邦 LLM 微调具备实际可行性。

9月8日周二
  1. arXiv:后门、投毒与隐私 ·

    Adaptive Diffusion Freezing:抵御成员推理攻击的隐私保护扩散模型

    针对扩散模型训练中的成员推理攻击(MIA)隐私风险,研究者提出隐私保护框架 Adaptive Diffusion Freezing(ADF)。该方法通过跨时间步自适应冻结训练,用掩码矩阵控制不同数据子集在各扩散时间步的参与,并基于预训练的风险感知冻结策略抑制高 MIA 风险子集-时间步对的贡献,从而减少过度记忆。在多个数据集上,ADF 取得了优于多种基线的隐私-效用-效率权衡表现。

  2. arXiv:后门、投毒与隐私 ·

    CANAL:面向医学图像分割差分隐私特征蒸馏的通道感知噪声分配

    CANAL 是一种面向医学图像分割的差分隐私特征蒸馏方法,通过每张图像仅释放一次、按任务梯度能量对通道做注水式噪声分配,并给出诚实计入隐私预算的拆分,在相同隐私预算下比均匀噪声保留更多任务相关信号。该方法针对此前流程中学生每次迭代重采样噪声导致隐私成本成倍复合、均匀噪声浪费通道重要性差异、以及裁剪阈值与重要性分数本身数据相关却明文释放这三个被忽视的问题。在皮肤镜、结肠镜和超声三个医学分割基准上验证了效果。

9月7日周一
  1. arXiv:后门、投毒与隐私 ·

    VERITAS:抗投毒的本地差分隐私图学习协议

    针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。

9月5日周六
  1. arXiv:后门、投毒与隐私 ·

    PAC-Private Autoregressive Generation:将 PAC 隐私扩展到自回归生成

    研究者将 PAC 隐私从分类扩展到自回归生成,用私有语料构建 m=128 个重叠世界、每个世界训练一个适配器,按各世界投票的后验加权分歧校准噪声,一致时无需加噪。在 WikiText-103 与 GPT-2-small 上,每 token 预算 2^{-32} 时保留 74% 微调收益,10^6 token 后成员推断成功率上限 51.08%。与 PMixED 在相同成员推断界下相比,10^2 至 10^6 token 区间保留 98% 非隐私余量,后者至多 56%。

9月3日周四
  1. arXiv:后门、投毒与隐私 ·

    DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架

    针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。

8月13日周四
  1. arXiv ·

    互补 LLM 水印如何追踪来源并检测篡改

    针对现有 LLM 水印在保留来源归属的同时可被"搭便车欺骗"篡改关键内容的问题,研究者提出一种同时提供来源证明与篡改证据的水印,在每个生成 token 中共同嵌入一个鲁棒信号和一个脆弱信号。两个信号机制相同但使用独立密钥和不同种子窗口,脆弱信号对读者可见的改动敏感;检测时两个分数构成二维空间,支持 Intact、Tampered、No-Watermark 三种判定。在两个大语言模型和两个提示数据集上,该方法在评测方法中取得最高篡改检测率,同时保持有竞争力的归属鲁棒性和困惑度。

7月3日周五
6月6日周六
  1. Simon Willison(提示注入) ·

    OpenAI 上线 Lockdown Mode,限制提示注入后的数据外泄

    OpenAI 正式上线 Lockdown Mode,此前在 2 月已有预告,现面向符合条件的个人账户(Free、Go、Plus、Pro)及自助式 ChatGPT Business 账户推送。该模式通过限制可能把敏感数据传给攻击者的对外网络请求,阻止提示注入攻击的最后一步数据外泄,但不会阻止提示注入出现在 ChatGPT 处理的内容中,例如缓存网页或上传文件里的注入仍可能影响回答的行为或准确性。Simon Willison 认为这一设计直接切断了致命三要素中的数据外泄环节,且所用机制是确定性的,不依赖可能被复杂攻击绕过的 AI 系统来判定。

4月1日周三
  1. Goodfire Research · · 原文 66

    Goodfire 与 Rakuten 用 SAE 探针在生产环境检测 PII

    Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。

    推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。

3月23日周一
  1. NVIDIA 技术博客:可信 AI 与网络安全 ·

    NVIDIA 如何为机密 AI 工厂构建零信任架构

    为机密 AI 工厂构建零信任架构,用于应对企业私有数据与 AI 模型结合时的隐私与信任风险。AI 正从实验走向生产,但企业所需的大部分数据位于公有云之外,包括患者记录、市场调研以及承载企业知识的遗留系统,隐私与信任顾虑常常拖慢甚至阻断 AI 的采用。

3月9日周一
2月5日周四
  1. Embrace The Red ·

    OpenAI 新论文详解基于 URL 的数据外泄缓解措施

    OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详细说明其为语言模型智能体新增的 URL 数据外泄缓解措施。作者曾在 2023 年初向 OpenAI 报告零点击数据外泄漏洞,当时 OpenAI 尚无漏洞赏金计划,问题未获修复;同期微软在 2023 年 5 月通过 Content-Security-Policy 头修复了 Bing Chat 的同类问题。

4月30日周三
12月5日周二
  1. 腾讯玄武实验室 ·

    腾讯玄武实验室提出端侧提示词隐私保护方案并开源中文权重

    腾讯安全玄武实验室提出一种可部署在端侧的提示词隐私保护方案,在调用云端 LLM 的流程中插入两个端侧步骤,先平行替换隐私实体完成脱敏,再还原云端输出中的隐私实体。方案用标注的平行语料训练了一个权重约 500MB 的小模型,基于开源模型 Bloom,在手机和笔记本上完成部署实验;仅用 CPU 时 MacBook M2 推理速度 180-200 tokens/s,MacBook M1 为 110-130 tokens/s,Pixel 8 Pro 为 20-30 tokens/s。原生支持润色、摘要、翻译、阅读理解和文本分类,并支持 Zero Shot 自定义扩展任务。

已经到底了