攻击arXiv 2609.29775·9月24日输出前缀攻击瞄准推理模型提出推理通道预填与输出前缀组合攻击以越狱推理模型arXiv2609.29775发表9月24日层提示层场景模型与 API攻击者黑盒被测模型Gemini 3 Flash Preview、DeepSeek V4 Flash、Claude Haiku 4.5攻击越狱技术推理链操控组件推理链+1+1深度解读完整解读
攻击arXiv 2603.13847·3月14日SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示arXiv2603.13847发表3月14日层应用层场景LLM 应用攻击者黑盒被测模型Meta-Llama-3.1-8B-Instruct、Gemma-3-4B、Qwen2.5-7B-Instruct 等 9 个攻击越狱技术跨模态载荷组件音频+1+1深度解读完整解读
攻击arXiv 2510.11570·2025年10月14日研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏提出四种阶段转换攻击,绕过推理模型的安全推理护栏arXiv2510.11570发表2025年10月14日层提示层场景模型与 API攻击者白盒、黑盒被测模型gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个攻击越狱技术推理链操控组件推理链+2+2深度解读完整解读