全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 论文arXiv:后门、投毒与隐私
DP-BR-FedAvg:面向银行与医疗的差分隐私拜占庭鲁棒联邦学习框架
针对联邦学习中参数更新泄露隐私与恶意客户端投毒两大问题,研究者提出 DP-BR-FedAvg 框架,将高斯机制差分隐私层与逐坐标截断均值拜占庭鲁棒聚合规则结合,在模拟跨机构欺诈与临床风险评分任务上评估。在 20 个客户端、其中四分之一为拜占庭节点、共 60 轮通信的设置下,FedAvg 在少数类上崩溃(F1 仅 0.030),该框架恢复至 F1 0.119,同时限制单个客户端贡献的隐私损失。无隐私层的拜占庭鲁棒聚合器原始准确率最高,量化了隐私对鲁棒性的代价,表明两类机制是相互作用而非简单叠加。
- 论文arXiv:后门、投毒与隐私
PAC-Private Autoregressive Generation:将 PAC 隐私扩展到自回归生成
研究者将 PAC 隐私从分类扩展到自回归生成,用私有语料构建 m=128 个重叠世界、每个世界训练一个适配器,按各世界投票的后验加权分歧校准噪声,一致时无需加噪。在 WikiText-103 与 GPT-2-small 上,每 token 预算 2^{-32} 时保留 74% 微调收益,10^6 token 后成员推断成功率上限 51.08%。与 PMixED 在相同成员推断界下相比,10^2 至 10^6 token 区间保留 98% 非隐私余量,后者至多 56%。
- 论文arXiv:后门、投毒与隐私
量子原生访问下量子机器学习(QML)的隐私风险刻画
针对量子机器学习(QML)隐私风险的研究,考察了具备量子计算能力与量子信息输出访问权的用户/对手对QML模型的成员推理攻击。研究表明,量子访问与量子计算能力的提升会带来可证明的理论隐私泄露和实证对抗增益,但QML的概率性质使理论与实证对抗优势之间存在差距。现有QML隐私泄露研究低估了新兴量子原生访问机制下的隐私泄露程度。
- 论文arXiv
研究揭示 LLM 交付物修订痕迹导致的无意泄露,并提出 RevLeakBench 基准
论文提出 LLM 助手在私密起草中删除或替换某条目后,仍可能在说明修改时重新暴露该条目,作者称之为修订痕迹。在三个公开对话语料库的实测分析中,共识别出 26,753 条修订请求,其中 2,363 条(8.8%)留下修订痕迹。作者构建了 RevLeakBench,覆盖五个场景的 100 项任务,分对话与 Agent 两条轨道,测量痕迹出现率、被撤回条目的可恢复率、痕迹位置和必要内容保留率。在六个模型上,两条轨道约一半的交付物在撤回后仍陈述了该修改,仅看交付物的读者可从约 13% 的交付物中恢复被撤回内容;即使告知模型整条回复将转发给接收方,仍有 36.4% 的交付物留下修订痕迹。
- 论文arXiv:后门、投毒与隐私
VERITAS:抗投毒的本地差分隐私图学习协议
针对本地差分隐私(LDP)图学习协议易受数据投毒攻击的问题,研究者提出抗投毒协议 VERITAS,采用"信任但验证"范式。该协议在用户侧引入编码分级信任等级的验证列表,对节点特征与图结构联合私有化,并在服务端利用双向证明不对称性识别和剪除恶意节点,流程包括本地数据扰动、证明驱动的恶意节点剪枝、双重去噪恢复效用和鲁棒隐私图学习四个阶段。在四个真实基准数据集、多种 LDP 机制与 GNN 架构上的实验显示,VERITAS 能有效防御数据投毒攻击,并在严格隐私保证下显著提升下游图学习效用。
- 论文arXiv:后门、投毒与隐私
FDBA:联邦学习中的细粒度分布式后门攻击
研究者提出细粒度分布式后门攻击框架 FDBA,用动态触发器生成与嵌入向量优化,在更少投毒样本下实施攻击。该方法基于 Canny 算法提取图像边缘特征并注入 Laplacian 噪声,再经 RGB 通道分解隐藏分布式触发器,同时用嵌入向量对比学习把投毒样本拉向目标类中心。在 CIFAR-10 上,目标 ASR 介于 70% 至 90% 时,FDBA 相比 DBA 减少 37.4%–48.4% 的投毒比例;Non-IID 极端异构下保留 84.7% 的 IID 攻击性能,DBA 降至 73.5%,并能绕过主流防御机制。
- 论文arXiv:后门、投毒与隐私
CANAL:面向医学图像分割差分隐私特征蒸馏的通道感知噪声分配
CANAL 是一种面向医学图像分割的差分隐私特征蒸馏方法,通过每张图像仅释放一次、按任务梯度能量对通道做注水式噪声分配,并给出诚实计入隐私预算的拆分,在相同隐私预算下比均匀噪声保留更多任务相关信号。该方法针对此前流程中学生每次迭代重采样噪声导致隐私成本成倍复合、均匀噪声浪费通道重要性差异、以及裁剪阈值与重要性分数本身数据相关却明文释放这三个被忽视的问题。在皮肤镜、结肠镜和超声三个医学分割基准上验证了效果。
- 论文arXiv:后门、投毒与隐私
Adaptive Diffusion Freezing:抵御成员推理攻击的隐私保护扩散模型
针对扩散模型训练中的成员推理攻击(MIA)隐私风险,研究者提出隐私保护框架 Adaptive Diffusion Freezing(ADF)。该方法通过跨时间步自适应冻结训练,用掩码矩阵控制不同数据子集在各扩散时间步的参与,并基于预训练的风险感知冻结策略抑制高 MIA 风险子集-时间步对的贡献,从而减少过度记忆。在多个数据集上,ADF 取得了优于多种基线的隐私-效用-效率权衡表现。
- 论文arXiv:后门、投毒与隐私
WPMIA:面向严格黑盒大模型的词级概率成员推断攻击
研究者提出 Word-level Probability MIA(WPMIA),一种面向严格黑盒场景的成员推断攻击,用于判断某段文本是否被纳入大语言模型的训练语料。该方法通过蒙特卡洛采样结合局部核平滑估计词级生成概率,再聚合成序列级似然估计,并构造不同前缀条件下的似然以放大成员与非成员之间的分布差异。在多个开源大语言模型上,WPMIA 一致优于现有黑盒基线;在 GPT-5-Chat、Gemini-2.5-Flash 和 Claude-4.5-Haiku 等闭源模型上,平均 TPR@5%FPR 达到 42.0。论文共 17 页、5 张图、17 张表,代码已公开。
- 论文arXiv:后门、投毒与隐私
论文揭示 BatchNorm 架构下机器遗忘评测的归一化伪影
论文发现基于 BatchNorm 架构的机器遗忘评测存在一个此前未被记录的混杂因素:对保留数据做一次前向传播、不修改任何权重,就能确定性地改写模型的归一化状态,并逆转表面指标上的遗忘效果。作者将该操作形式化为保权重的固定点算子,并证明其造成的遗忘前后差距可归因于 BN 运行统计量,而非遗忘方法对权重的修改,从而把测量失败与编码器失败区分开。实验显示,该伪影在标准基准的九种方法上最多逆转 78 个百分点的遗忘准确率;攻击者仅用 10 张无标签图像即可恢复大部分被掩盖的准确率;改用严格的 GroupNorm 后,所有方法的伪影降为零。测试的成员推断攻击在重新校准后变化不大,说明评测失败集中在遗忘准确率和线性探测上。
- 论文arXiv:后门、投毒与隐私
SoK 综述:可解释性 AI 如何成为机器学习隐私攻击面
这篇 SoK 系统梳理了 25 项利用模型解释输出实施隐私攻击的研究,涵盖模型窃取、成员推断和模型反演,并将属性推断视为部分反演。作者指出,现有工作常只按黑盒或白盒标注,掩盖了对手实际获得的解释信号差异,因此把模型知识与解释获取分开,归纳出五条路径:目标方发布、攻击者自行推导、二次披露、特权访问和公开全局产物。在这些路径下,解释会降低窃取成本,通过解释统计量、recourse 距离和解释引导的鲁棒性暴露成员信号,并支持对私有输入做空间或代数重建。
- 论文arXiv:后门、投毒与隐私
差分隐私合成文本的子群成员推断审计
针对差分隐私合成文本发布,研究提出子群定向成员推断博弈,将目标池设为显式参数,在四个数据集、三种生成器(DP-SGD 微调、API 提示、激活引导)和五个隐私预算下审计了 32 个代理。审计显示合成发布确实泄露子群成员身份,既有攻击系统性低估该泄露;DP 在各预算下大幅降低平均泄露,但剩余泄露集中,十分之一记录约占 40%,且噪声对随机记录的去泄露效果强于高风险记录,哪些记录泄露取决于发布机制而非记录本身。
- 论文arXiv:后门、投毒与隐私
CGMIA:用成员推理攻击检测代码生成基准的数据泄漏
针对代码生成基准数据泄漏导致评测虚高的问题,研究者提出 CGMIA(Code-Generation-specific Membership Inference Attack),通过在基准样本子集上微调影子模型构建成员与非成员标注数据,并融合 CodeBLEU、编辑距离、测试通过率、困惑度等专家特征与 CodeBERT 嵌入语义特征进行集成学习,判断样本是否进入目标模型训练集。在八个代码生成基准上,CGMIA 多数情况下优于八种现有成员推理方法,并有效检出 StarCoder-7B 训练数据中已知泄漏的 APPS 样本。
- 论文arXiv:后门、投毒与隐私
针对 NLP 文本分类器的成员推理攻击实证评估:SST-2 基线研究
一项在 GLUE SST-2 情感数据集上的受控基准测试比较了 TF-IDF + Logistic Regression 与微调 DistilBERT 在 loss-threshold 成员推理攻击(MIA)下的隐私泄露情况。DistilBERT 开发集准确率 0.9466、macro F1 0.9460,Logistic Regression 为 0.8756 和 0.8727,但两者均泄露成员信号,攻击 AUC 分别为 0.5615 和 0.5800。
- 论文arXiv:后门、投毒与隐私
用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理
研究发现,来自重尾自正则化框架的 WeightWatcher 谱指标可替代昂贵的影子模型,用于评估机器学习模型的成员推理攻击(MIA)风险。在图像与表格分类任务上,stable rank 与整体 MIA 成功率呈强正相关,Log alpha-Norm 在低假阳性区间与 MIA 脆弱性持续负相关,且这两种关联均强于泛化差距所给出的结果。这表明神经网络谱中包含过拟合常规指标未能捕捉的隐私泄露信息,为可扩展的隐私审计提供了新方向。
- 论文arXiv:后门、投毒与隐私
PL-MIA:基于成对似然比的成员推理攻击
研究者提出 Pairwise Likelihood MIA(PL-MIA),将高斯似然比(GLR)统计量与总体校准、Cauchy 组合检验结合,用于审计机器学习模型的成员隐私风险。该方法对查询点与未参与训练的参考点做成对比较得到 p 值,再用 Cauchy 组合检验聚合连续信号,保留被二值投票丢弃的证据强度。实验显示,在低假阳性关键区间,PL-MIA 的真阳性率(TPR)较强基线提升超过 25%。
- 论文arXiv:后门、投毒与隐私
基于 Hessian 分析的相关性引导快速机器遗忘
一种面向网络与分布式安全系统的机器遗忘框架通过识别训练集中的相关数据点并应用闭式参数更新规则,相比标准影响函数遗忘实现 82 倍墙钟加速,准确率较 SOTA 基线提升 10^-2。该方法借助 Hessian 阻尼保证数值稳定性,在包括 CIFAR-100 与 ResNet-50 在内的七种数据集-架构组合上评估,成员推理攻击成功率为 0.660,tug-of-war 得分为 0.950。
- 论文arXiv:后门、投毒与隐私
CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击
论文提出 CIG-MIA,一种基于上下文信息增益的成员推断攻击,用于判断某文档是否属于 RAG 系统的知识库,覆盖灰盒与纯文本黑盒两种访问设定。其思路是显式注入候选文档对成员与非成员影响不同:文档已可通过检索获得时注入带来的额外支持很小,文档不在库中时注入引入新证据、似然增益更大。灰盒设定下直接由 token 级似然计算该增益,黑盒设定下用轻量代理估计器结合语义相似度与精确匹配特征,从生成文本中估计同一增益。
- 论文arXiv:后门、投毒与隐私
QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御
作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。
- 论文arXiv:Agent 与 MCP 安全
可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架
一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。
- 论文arXiv:越狱、提示注入、投毒与防御
透过人眼与机器眼:理解视频透视扩展现实中的视图错配
视频透视扩展现实(VST XR)系统常以头显截图作为用户第一人称视觉上下文的代理,但系统捕获的矩形画面与用户实际可见的非矩形区域并不一致。研究在 Meta Quest 3 上开展试点级边界测量,证实截图帧与近似人类可见边界存在明显错配,并形式化了共见、仅系统可见与仅人类可见三类区域。基于该模型,四项案例研究显示视图错配可引发提示注入、隐私泄露、人类不可见信息偏差及人类可见信息缺失等风险,说明这不仅是几何问题,也带来安全、隐私与可靠性隐患。
- 论文arXiv:越狱、提示注入、投毒与防御
PrivDrift:审计活跃 LLM 对话中话题漂移下的用户秘密泄露
研究者提出 PrivDrift 基准,用于审计用户披露的秘密在对话话题漂移和说服式探测后是否仍可被恢复。该基准包含 1000 组受控多轮对话,设有植入秘密、内容密集的漂移轮次和标准化提取探测。在三个具备扩展上下文窗口的 LLM 上,对话级混合泄露率在 38.7% 至 54.6% 之间,并随模型、秘密类型和说服强度明显变化。在测试的漂移窗口内,额外的话题漂移并未可靠降低泄露,作者据此认为活跃 LLM 场景中的隐私风险应被视为持续的行为失效模式,而非仅训练数据记忆或即时越狱行为。
- 论文arXiv:越狱、提示注入、投毒与防御
论文提出保险库中介执行边界,评估 LLM Agent 的 API 凭据处理风险
论文将工具调用型 LLM Agent 的凭据卫生问题定义为执行安全问题,并评估了一种保险库中介执行架构:模型只选择连接器标识符,由可信请求边界提供认证。作者在 Corvic Security Vault 的生产实现上做了两组受控黑盒实验,覆盖七个控制域的 16 项探测全部达到预期结果,包括一次已认证的 GitHub API 请求成功,而凭据未出现在进程环境变量、调用方可见请求头、受测文件系统位置、三个第三方回显服务和两个无关 API 源中,两个云实例元数据端点均不可达。论文同时报告了一个负面结果:某连接器的存储请求头映射不满足其提供方的认证契约,说明集中托管本身不能保证配置正确。
- 动态AI Incident Database
西班牙 AEPD 收到首例由 AI 智能体自主执行的个人数据泄露通报
西班牙数据保护局(AEPD)本周一收到该国首例个人数据泄露通报,其中攻击据称由一个使用某知名大语言模型的 AI 智能体执行。该事件使攻击者得以进入系统、利用漏洞、修改个人数据并查询发票。攻击从在通用文件中搜索漏洞开始,借助一次有效登录进入系统,随后智能体自主在应用中继续寻找缺陷,直到找到可修改个人信息并访问发票的路径。AEPD 强调,现有信息来自受影响组织提交的通报,仍需进一步分析,尚不能据此得出确定性结论;使用某一特定 AI 模型并不意味着该模型或其供应商的基础设施被攻破,也不意味着该工具被设计用于恶意活动。AEPD 认为关键在于第三方把 AI 智能体当作工具,自主串联了网络攻击的不同阶段,并指出这类事件表明 AI 辅助攻击已不再是纯理论风险。