跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.06749· Sicong Li·· 25 天前

PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法

A Novel Semantic Manifold Alignment Attack against Embedding-to-Embedding Obfuscation in Privacy-Preserving LLMs

AI 导读

作者提出 Proxy Manifold Alignment(PMA),一种针对隐私保护 LLM 中 Embedding-to-Embedding Obfuscation(E2EO)方案的密文到明文重建攻击。其核心观察是 E2EO 保留了原始语义结构,因此混淆后的向量流可视为一种符号即向量本身的未知分词语言,攻击被建模为从该未知语言到明文的翻译任务。PMA 仅需访问混淆向量流、目标分词器和公开语料,先用 Word2Vec 分别建模混淆流与公开语料的共现模式并构建两个代理嵌入向量,再基于结构相似性对齐两者的底层流形,最后把混淆向量映射回明文。实验结果显示,PMA 的明文恢复效果持续高于其他 SOTA 攻击方法。

阅读原文arxiv.org