TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击
提出TRANSCOPE,用CPU硬件计数器推断训练集成员
- 核心定位:TRANSCOPE 是一种无需模型内部权重、不依赖置信度分数和执行时序差异的硬件辅助微架构成员推断与分布外检测技术。
- 要解决的问题:现代大语言模型和视觉 Transformer 普遍采用静态无分支前向传播,且行业正转向本地闭源二进制部署并屏蔽输出置信度,导致传统软件 MIA 和既有硬件侧信道攻击失效。
- 方法核心机制:论文发现模型训练导致高频词元聚集而生疏词元分散,这种几何跨度直接影响嵌入表的内存页面局部性,进而在底层触发可观测的 TLB 未命中、页表遍历和能耗差异。
- 关键实验结果:在 Intel CPU 上,TRANSCOPE 在 BERT-base 上达到 99% 准确率和 0.99 AUC(Table III);在真实纽约时报文章测试中,训练集截断前文章相比后续文章减少 56% 非核心读取(Figure 12);单次推理能耗呈现 2.6%–4.5% 的非成员额外开销(Figure 3)。
- 结论与启示:作者指出,模型训练足迹已深刻烙印在处理器的微架构执行状态中,单纯依赖软件层面的置信度离散化和恒定时间填充已不足以保障隐私,硬件设计必须重新审视 AI 工作负载下的内存层级与侧信道泄露。