攻击arXiv 2510.11570·2025年10月14日研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏提出四种阶段转换攻击,绕过推理模型的安全推理护栏arXiv2510.11570发表2025年10月14日层提示层场景模型与 API攻击者白盒、黑盒测试gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个攻击越狱技术推理链操控组件推理链+2+2深度解读完整解读
防御arXiv 2609.16229·9月15日ARIA:用稀疏自编码器实现测试时机器遗忘提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控arXiv2609.16229发表9月15日层模型层场景模型与 API攻击者白盒测试DeepSeek-R1-Distill-Qwen-1.5B、Gemma-3-1B-it防御推理时干预攻击提取与窃取组件推理链+2+2深度解读完整解读
防御arXiv 2609.20129·9月17日局部稀疏性实现无监督 LLM 安全检测提出局部稀疏无监督安全检测,标记偏离安全分布的输入arXiv2609.20129发表9月17日层模型层场景模型与 API测试qwen2-1.5b-instruct、ministral-8b-instruct、llama3-8b-instruct 等 6 个防御监控与审计攻击越狱组件监控器深度解读完整解读