攻击arXiv 2609.06749·9月7日PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文arXiv2609.06749发表9月7日层模型层场景模型与 API测试BERT-base、RoBERTa-base、T5-base 等 6 个攻击提取与窃取组件嵌入深度解读完整解读
防御arXiv 2609.16229·9月15日ARIA:用稀疏自编码器实现测试时机器遗忘提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控arXiv2609.16229发表9月15日层模型层场景模型与 API攻击者白盒测试DeepSeek-R1-Distill-Qwen-1.5B、Gemma-3-1B-it防御推理时干预攻击提取与窃取组件推理链+2+2深度解读完整解读