防御arXiv 2609.16229·9月15日ARIA:用稀疏自编码器实现测试时机器遗忘提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控arXiv2609.16229发表9月15日层模型层场景模型与 API攻击者白盒测试DeepSeek-R1-Distill-Qwen-1.5B、Gemma-3-1B-it防御推理时干预攻击提取与窃取组件推理链+2+2深度解读完整解读
防御arXiv 2609.36603·9月29日SED:面向 LLM 智能体的免训练持续安全策略学习框架提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略arXiv2609.36603发表9月29日层应用层场景AI Agent测试DeepSeek-V4-Flash、GLM-5.2、Kimi K3防御监控与审计攻击提示注入组件记忆+2+2深度解读完整解读