攻击arXiv 2603.13847·3月14日SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示arXiv2603.13847发表3月14日层应用层场景LLM 应用攻击者黑盒攻击越狱技术跨模态载荷组件音频+1+1深度解读完整解读
风险行为arXiv 2609.08186·9月8日论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱arXiv2609.08186发表9月8日层模型层场景模型与 API攻击越狱风险失准与价值偏离技术推理链操控组件推理链摘要更深推理提升题目准确率,同时提高扰动下的相对损失。作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。深度解读完整解读