摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
全部论文
另有 426 篇论文还没打上分类标签,暂不在筛选结果里。
- 攻击arXiv 2610.06093
研究评测训练数据提取风险的跨语言迁移
用翻译前缀做跨语言训练数据提取,恢复英语训练文本中的 PII
- arXiv
- 2610.06093
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击提取与窃取
摘要跨语言 TDE 能恢复英语记忆的 PII,转移随多语训练和措辞保真变化。
这篇工作检验训练数据抽取是否跨语言:英语段落里记住的 PII,能否被其他语言的前缀逐字抽出。
摘要激活已恢复大部分 token。
这篇工作测量 split learning 分裂点上的文本泄漏:激活单独能恢复多少,训练回传的梯度再增加多少,以及按 token 还是按整篇计分会不会改写结论。
- 攻击arXiv 2610.06848
TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
- arXiv
- 2610.06848
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
- 攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
- 攻击arXiv 2610.01871
研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像
提出 imMRAG 攻击,从多模态 RAG 私有图像库提取内容
- arXiv
- 2610.01871
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 攻击者
- 黑盒
- 攻击arXiv 2609.04382
研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过
揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容
- arXiv
- 2609.04382
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击提取与窃取
摘要论文揭示拆分训练中反向梯度零支撑完全暴露诱饵行,联合视图突破门控,裁剪加噪可有效缓解。
这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。
- 攻击arXiv 2608.09867
研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
- arXiv
- 2608.09867
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
- 攻击arXiv 2609.35699
论文:蒸馏防御在蒸馏后强化学习下易被攻破
提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御
- arXiv
- 2609.35699
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要更现实的蒸馏攻击是蒸馏后再 RL。
这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击arXiv 2609.10117
研究揭示基于混淆的端侧 LLM 保护方案的安全边界
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
- arXiv
- 2609.10117
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
- 攻击arXiv 2609.12911
研究:置换式保密在混合 FHE 推理中失效,可精确恢复 ResNet-20 全部线性层
攻破混合 FHE 推理的置换式保密,精确恢复线性层排序谱
- arXiv
- 2609.12911
- 发表
- 场景
- 模型与 API
- 攻击提取与窃取
- 攻击arXiv 2609.00873
研究提出 Q-Skew:利用 token 级记忆不对称对微调扩散语言模型做成员推断
提出 Q-SKEW,利用 token 级记忆不对称推断微调扩散语言模型的成员
- arXiv
- 2609.00873
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 攻击提取与窃取
摘要Q-SKEW 用 token 损失差的右偏区分微调 DLM 成员,并可辅助 PII 排序。
Q-SKEW 是针对微调扩散语言模型的 gray-box 成员推断指标,依据是 token 记忆增益随掩码率下降而增大、成员序列因此右偏。。
摘要黑盒 TTS 成员推断以 recitation 加分层语音表示为分数,说话人级强于记录级,DP-SGD 可压到随机附近。
作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。
- 攻击arXiv 2609.05702
量子原生访问下量子机器学习(QML)的隐私风险刻画
证明量子原生访问会增强量子模型的成员推断优势
- arXiv
- 2609.05702
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击提取与窃取
摘要量子原生访问使 QNN 成员推断优势按 C⪯M⪯Q 增加,有限影子模型留下可上界的经验差距。
作者研究 量子原生访问下 QNN 的成员推断:对手不再只拿到固定测量的经典比特。
- 攻击arXiv 2609.10611
WPMIA:面向严格黑盒大模型的词级概率成员推断攻击
提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员
- arXiv
- 2609.10611
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击提取与窃取
摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。
WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。
- 攻击arXiv 2609.09865
CGMIA:用成员推理攻击检测代码生成基准的数据泄漏
提出 CGMIA,用成员推理检测代码生成基准的数据泄漏
- arXiv
- 2609.09865
- 发表
- 层
- 模型层
- 场景
- 编程 Agent
- 攻击者
- 灰盒
- 攻击提取与窃取
摘要CGMIA 融合相似度、通过率、困惑度与 CodeBERT,在模拟泄漏上优于八个 MIA 基线。
CGMIA 用成员推断检测代码生成基准是否泄入 LLM 训练集,使评测不依赖对训练语料的直接访问。
- 攻击arXiv 2609.14649
CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击
提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份
- arXiv
- 2609.14649
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。
CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。
- 攻击arXiv 2609.36941
研究者提出针对黑盒 LLM 的实用密钥提取框架
提出用扰动蒸馏本地代理并离线过滤来提取黑盒模型凭据
- arXiv
- 2609.36941
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 攻击提取与窃取
摘要论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。