防御arXiv 2609.37054·9月29日ACTR:对齐推理与回答以提升推理大语言模型的多语言安全提出 ACTR,只更新安全思考神经元以对齐推理与回答的安全类别arXiv2609.37054发表9月29日层训练与数据层场景模型与 API被测模型Qwen3-8B、Gemma4-12B-it防御模型加固攻击越狱组件推理链深度解读完整解读
防御arXiv 2609.34519·9月28日EOPSA:高效在策略自蒸馏安全对齐方法提出 EOPSA,用 TRR 截断与安全类过滤做在策略自蒸馏安全对齐arXiv2609.34519发表9月28日层训练与数据层场景模型与 API被测模型Qwen3-1.7B、Qwen3-4B、Qwen3-14B 等 5 个防御模型加固攻击越狱组件推理链深度解读完整解读