摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
全部论文
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
摘要激活已恢复大部分 token。
这篇工作测量 split learning 分裂点上的文本泄漏:激活单独能恢复多少,训练回传的梯度再增加多少,以及按 token 还是按整篇计分会不会改写结论。
- 攻击arXiv 2610.06848
TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
- arXiv
- 2610.06848
- 发表
- 场景
- 模型与 API
- 攻击者
- 黑盒
摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。
- 防御arXiv 2610.02418
Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
- arXiv
- 2610.02418
- 发表
- 场景
- 模型与 API
- 攻击arXiv 2610.01365
ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联
提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联
- arXiv
- 2610.01365
- 发表
- 场景
- 模型与 API
摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。
- 攻击arXiv 2609.04382
研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过
揭示拆分训练返回梯度以零支撑暴露诱饵行并泄露训练内容
- arXiv
- 2609.04382
- 发表
- 场景
- 模型与 API
- 攻击者
- 白盒
- 攻击提取与窃取
摘要论文揭示拆分训练中反向梯度零支撑完全暴露诱饵行,联合视图突破门控,裁剪加噪可有效缓解。
这是一项关于双节点大语言模型拆分训练系统的系统安全案例研究,揭示了评估工具遗漏反向信道所导致的静默隐私失效。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击arXiv 2609.10117
研究揭示基于混淆的端侧 LLM 保护方案的安全边界
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
- arXiv
- 2609.10117
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要Oprior 是四原语复合的安全边界,Collapse 利用列方向泄漏抽取替代模型,Oext 只被同一攻击评测。
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。
- 防御arXiv 2609.23586
VidMark:面向视频生成模型知识产权保护的高效水印方案
提出 VidMark 水印方案,核验视频生成模型的输出来源与所有权
- arXiv
- 2609.23586
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要VidMark 加解码器引导微调,把模型签名写入 VGM 输出并用于两项核验。
Huang 等人提出一套面向视频生成模型的生成内嵌水印方案,用来同时判断一条视频是否来自受保护模型,以及一个嫌疑模型是否为该模型的拷贝。
- 防御arXiv 2609.16229
ARIA:用稀疏自编码器实现测试时机器遗忘
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
- arXiv
- 2609.16229
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 白盒
- 防御arXiv 2609.15671
QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御
提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露
- arXiv
- 2609.15671
- 发表
- 场景
- 模型与 API
摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。
QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。
已经到底了