论文揭示多租户 RAG 账号合谋使隐私泄露随账号数线性增长
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私
- arXiv
- 2605.19847
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- MultiTenantRAGService、FAISS、HNSW (M=64, efcstr=200, efq=128) 等 4 个
摘要揭示多租户 RAG 合谋泄露按根号 k 放大,提出带零知识证明的无泄露审计协议。
论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。
另有 558 篇论文还没打上分类标签,暂不在筛选结果里。
提出零知识审计协议,核验多租户 RAG 的合谋差分隐私
论文针对多租户 RAG 服务在多账户协同攻击下隐私边界失效的问题展开研究。
提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能
论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 SigLeak,从良性查询的执行轨迹推断专有 Agent 技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御
这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。
提出 TULIP,按输入定位形成层并去除目标 token 对齐以实现定向遗忘
TULIP 是一种逐输入选择层的表示级遗忘方法,目标是去掉遗忘答案的形成、留下读出。输出级方法可能只压低特定回答的似然。RMU、LUNAR 等则对全部遗忘样本共用一层。
比较高效与高成本训练的对抗和隐私脆弱性并分析损失几何
作者在视觉分类和数学推理语言模型上,检查用更少数据或更简对齐换取训练效率时,安全性质是否一起变化。比较在任务效用接近的前提下进行。视觉侧用 KNN-Shapley 的高重要性小子集对照低重要性大子集,并用预训练微调对照从头训练。
提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性
AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
提出 SCALPEL,用对比 SAE 在表征层选择性遗忘特定事实
SCALPEL 是不改基座权重的表征层遗忘方法,面向与保留数据重叠的窄目标。
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出 LeakGauge,用行为后缀的 prefill 对数概率检测上下文泄露
提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员
Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。
提出针对微调 TTS 的黑盒成员推断攻击
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器
证明量子原生访问会增强量子模型的成员推断优势
作者研究 量子原生访问下 QNN 的成员推断:对手不再只拿到固定测量的经典比特。
提出 Adaptive Diffusion Freezing,降低扩散模型的成员推理风险
占位。
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。