跳到正文
10月10日 · 周六

越狱与攻击 · 论文

找到 1 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 攻击arXiv 2606.11817

    研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御

    提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-Coder-7B、Qwen2.5-Coder-32B、Qwen2.5-7B 等 10 个

    摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。

    深度解读完整解读
已经到底了