防御arXiv 2609.14258·9月13日SPARK:在 KV 记忆层对齐表征以防御视觉语言模型越狱提出 SPARK,在预填充阶段修复多模态 KV 记忆以防御视觉语言模型越狱arXiv2609.14258发表9月13日层模型层场景模型与 API攻击者白盒测试LLaVA-OneVision-7B、Chameleon-7B、Qwen2-VL-7B 等 4 个防御推理时干预攻击越狱组件视觉深度解读完整解读
攻击arXiv 2609.06749·9月7日PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文arXiv2609.06749发表9月7日层模型层场景模型与 API测试BERT-base、RoBERTa-base、T5-base 等 6 个攻击提取与窃取组件嵌入深度解读完整解读