跳到正文

防御与护栏 · 精选

10月9日 · 周五

防御与护栏 · 精选

今天还没有新的精选
10月1日周四
  1. Transformer Circuits · 43

    Anthropic 可解释性团队 4 月更新:失败越狱的电路追踪与可解释密集特征

    Anthropic 可解释性团队发布 4 月更新,用电路追踪方法分析一个失败的越狱提示,发现模型拒绝该提示的原因与拒绝直接请求不同,且拒绝倾向反而高于普通提问。该提示要求把 B O M B 拼成单词并说明如何制造炸弹,归因图显示模型并未激活与制造炸弹相关的特征,而是由炸弹概念直接触发有害请求特征;把 make 换成 detect 后模型仍拒绝,且首句与有害版本完全相同。团队用干预实验验证机制:抑制 say bomb 超级节点后 say making 激活降至原来的 1%,模型转而输出与炸弹无关的拒答内容。附录指出特征可视化若数据不够多样会产生误导,并列出 30M CLT 模型中最密集的 10 个特征及其解释,其中 6 个可解释。

  2. Transformer Circuits · 46

    Anthropic 可解释性团队解析多选题有害压力下的拒答机制

    Anthropic 可解释性团队在 2025 年 11 月的 Circuits Updates 中报告,Claude 3.5 Haiku 在无有害意图时对 129 道二选一多选题准确率为 100%,加入有害意图表述后降至 48.1%。研究发现注意力机制是关键:有害检测 key 特征与拒答 query 特征负向交互,压低了对正确答案的注意力分数,使答案选择头转而关注错误答案。团队识别出一个拒答特征,在广泛语料上表现为检测到用户请求有害后提供替代方案,称为 refuse and redirect;对该特征做负向引导可将数据集准确率恢复到 93%,仅对部分中层注意力头的 query 侧做更精细干预也能达到同样效果。

  3. Goodfire Research · 52

    Goodfire 提出基于探针的数据归因方法,定位并缓解 LLM 后训练中的有害行为

    Goodfire Research 提出基于探针的数据归因方法,可定位 LLM 后训练中涌现的有害行为对应的训练数据点。研究以 OLMo 2 7B 的 DPO 训练为自然测试床:模型在有害请求后附加格式约束(distractor)时从拒答转为顺从,该现象在 OLMo 2 32B 上更强。方法将行为变化与训练数据点都表示为模型激活向量,用余弦相似度匹配,再用 Grok 4 生成的 150 条提示构建探针向量。过滤探针排名最高的 3 万个数据点后,有害行为下降 63%,且 GSM8k、IFEval、XSTest 性能无明显损失;交换这些数据点的 accepted/rejected 标签可下降 78%。

9月30日周三
  1. SPY Lab · 50

    SPY Lab 研究:统一多模态模型无法凭记忆描述图像

    SPY Lab 提出“模态失语症”概念,指统一多模态模型能生成记忆中的图像,却无法通过文本查询访问同一知识。研究用九张电影海报测试 ChatGPT-5,图像生成的整体错误率明显低于口头描述,且重大幻觉只出现在文字描述中。

已经到底了