防御arXiv 2609.16229·9月15日ARIA:用稀疏自编码器实现测试时机器遗忘提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控arXiv2609.16229发表9月15日层模型层场景模型与 API攻击者白盒测试DeepSeek-R1-Distill-Qwen-1.5B、Gemma-3-1B-it防御推理时干预攻击提取与窃取组件推理链+2+2深度解读完整解读
评测与基准arXiv 2609.02168·9月2日FUSE:面向大语言模型危险能力的模块化评测框架提出 FUSE 框架,评测大语言模型的化生危险能力arXiv2609.02168发表9月2日层模型层场景模型与 API测试Claude-3-Haiku、Claude-Opus-4、Claude-Opus-4.5 等 13 个攻击越狱风险危险能力深度解读完整解读