攻击arXiv 2510.11570·2025年10月14日研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏提出四种阶段转换攻击,绕过推理模型的安全推理护栏arXiv2510.11570发表2025年10月14日层提示层场景模型与 API攻击者白盒、黑盒测试gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个攻击越狱技术推理链操控组件推理链+2+2深度解读完整解读
攻击arXiv 2609.24994·9月22日BAM 反馈编码实现推理时隐蔽的智能体通信提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷arXiv2609.24994发表9月22日层模型层场景多智能体攻击者黑盒测试Llama-3.1-8B、Qwen-3.5-9B-Base、Mistral-7B-v0.3 等 6 个攻击检测规避技术编码与混淆深度解读完整解读