跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 201 篇还没打标签,不在筛选结果里。

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2605.08513

    Apple 研究者发现抑制单个神经元即可绕过 LLM 安全对齐

    提出单神经元激活干预,抑制拒答神经元或放大概念神经元以绕过安全对齐

    发表
    攻击者
    白盒
    被测模型
    Qwen3-1.7B、Qwen3-4B、Qwen3-8B 等 11 个

    摘要作者称大模型安全由拒答门控与概念底座构成,干预单个神经元足以双向击穿对齐,且拒答神经元在预训练阶段已然存在。

    深度解读完整解读
已经到底了