跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 1 篇
筛选1

攻击类型

模型自身风险

影响

系统形态

攻击面/入口

层

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 可解释性arXiv:2610.05541 ·

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    提出CAP与CSFD,发现越狱通过压制安全特征绕过拒答

    测试
    Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个模型层
    摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。
    • 定位与核心问题:本研究从机械可解释性视角切入,聚焦大语言模型在面对越狱攻击时内部处于静默状态的转码器特征,探讨越狱是否通过抑制安全关键特征而非单纯激活有害表征来绕过拒答。
    • 核心方法:提出反事实激活潜能(CAP)指标,将编码器对齐度、归因抑制强度与消融安全关键性三者相乘,量化静默特征的激活倾向;并提出两阶段算法 CSFD,结合期望激活差与 Cohen's d 在无需穷举消融的前提下快速筛选候选特征。
    • 因果有效性验证:在 5 款被测模型上,CSFD 筛选的候选特征中有 78% 至 100% 具有因果有效性,消融单个特征可使有害拒答翻转为顺从,翻转率最高达 82.5%(Gemma-3-4B-IT,Table 1)。
    • 自然越狱与机制干预证据:在 PAIR 越狱攻击下,高 CAP 安全特征所受抑制强度上升 2 至 4 倍,激活下降达 80%(Qwen3-1.7B,Table 3);在有害拒答提示词上仅放大抑制源 8 倍,即可使拒答翻转率达 0.29(Table 2)。
    • 表征能力优于传统基线:基于 50 个候选特征的 CAP 分解探针在 Gemma-2-2B 上区分良性与拒答的 AUROC 达到 0.788,优于残差流拒答方向(DIM)的 0.546 及全特征原始激活的 0.668(Table 4)。
    • 作者结论与启示:作者指出越狱攻击可部分通过抑制关键安全特征实现,拒答行为由多个特征构成的分布式回路介导;单独恢复任一特征难以恢复拒答,未来的安全解释性与防御设计需将注意力扩展至被抑制的静默特征。
    完整解读
已经到底了