攻击arXiv 2606.11817
研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御
提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御
- arXiv
- 2606.11817
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- Qwen2.5-Coder-7B、Qwen2.5-Coder-32B、Qwen2.5-7B 等 10 个
摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。