攻击arXiv 2510.11570·2025年10月14日研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏提出四种阶段转换攻击,绕过推理模型的安全推理护栏arXiv2510.11570发表2025年10月14日层提示层场景模型与 API攻击者白盒、黑盒攻击越狱技术推理链操控组件推理链+2+2深度解读完整解读
攻击arXiv 2609.09553·9月9日研究:任意密文攻击前沿大模型无需微调即可越狱提出任意字母置换密码越狱,无需微调即可诱导有害输出arXiv2609.09553发表9月9日层提示层场景模型与 API攻击者黑盒攻击越狱技术编码与混淆组件护栏与评审+2+2摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。深度解读完整解读