防御arXiv 2610.02418·10月1日Whiteout:用混淆样本阻止 LLM 泄露个人敏感信息提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联arXiv2610.02418发表10月1日层训练与数据层场景模型与 API攻击者黑盒、白盒被测模型Llama 3.2、Phi-3-mini、Gemma 3 等 7 个防御模型加固攻击提取与窃取深度解读完整解读
防御arXiv 2609.16229·9月15日ARIA:用稀疏自编码器实现测试时机器遗忘提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控arXiv2609.16229发表9月15日层模型层场景模型与 API攻击者白盒被测模型DeepSeek-R1-Distill-Qwen-1.5B、Gemma-3-1B-it防御推理时干预攻击提取与窃取组件推理链+2+2深度解读完整解读