攻击arXiv 2609.09553
研究:任意密文攻击前沿大模型无需微调即可越狱
提出任意字母置换密码越狱,无需微调即可诱导有害输出
- arXiv
- 2609.09553
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出任意字母置换密码越狱,无需微调即可诱导有害输出
摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。
提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。