跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.02853

    研究提出基于收缩约束状态空间模型的有界可达性与越狱检测方法

    提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱

    发表
    攻击者
    白盒、黑盒
    被测模型
    ToySSMClassifier、S4 safety head
    摘要收缩给出玩具 LTI 的有界认证。

    给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。

    深度解读完整解读
  2. 攻击arXiv 2503.02174

    研究者提出对抗分词攻击,可在不改文本的情况下绕过 LLM 安全限制

    提出 AdvTok 对抗分词攻击,不改文本只改分词来越狱并规避安全分类器

    发表
    攻击者
    灰盒
    被测模型
    Llama3.2-1B、Llama3.2-3B、Llama3.1-8B 等 7 个
    摘要作者称非规范分词能躲开对齐并仍得到针对原请求的回复。

    作者用非规范分词攻击已对齐的子词 LLM:恶意字符串的字符不变,只改 token 边界。

    深度解读完整解读
已经到底了