跳到正文

开源模型安全

开源权重模型的安全:去除安全训练、微调攻击与权重安全。

22条精选相关主题后门与投毒MetaDeepSeek

最新精选

第 21–22 条 · 共 22 条
2月19日周三
  1. Transformer Circuits(Anthropic 可解释性) · 72

    Anthropic 可解释性团队:Crosscoder 模型差异分析中独占特征多义性的成因与缓解

    Anthropic 可解释性团队报告了 crosscoder 模型差异分析(model diffing)中的一项意外现象:仅属于某一个模型的特征往往更多义、激活更密集,因而难以解释。团队用玩具模型复现了这一模式,认为其源于特征容量竞争——共享特征能同时解释两个模型的神经元激活,独占特征必须编码更多信息才能争取到分配额度。他们提出的缓解办法是划出一小部分指定共享特征并降低其稀疏惩罚,在约 25 万个特征中分配 1 万个、惩罚系数取基线的 0.1–0.2 倍,使独占特征变得更单义。

    推荐理由Anthropic 可解释性团队公开了 crosscoder 模型差异分析中独占特征多义性的成因与缓解方法,适合关注机制可解释性工具的研究者参考。

10月25日周五
  1. Transformer Circuits(Anthropic 可解释性) · 66

    Anthropic 提出稀疏 Crosscoder,用于跨层特征与模型差异分析

    Anthropic 可解释性团队发布研究更新,提出稀疏 crosscoder,一种可同时读写多层激活的稀疏编码器,用于理解叠加表示中的跨层特征。与只在单层编码的 autoencoder 和用一层预测下一层的 transcoder 不同,crosscoder 能产出跨层甚至跨模型的共享特征,可用于解析跨层叠加、简化电路以及做模型差异分析。团队在 18 层模型上对比了全局 acausal crosscoder 与 18 个逐层 SAE:在总特征数相同时 crosscoder 的 eval loss 明显更优,说明层间存在大量冗余结构;但按训练 FLOPs 计,crosscoder 达到同等 eval loss 的效率约低 2 倍。

    推荐理由Anthropic 可解释性团队提出跨层稀疏编码器,把跨层与跨模型特征纳入同一字典,为模型差异审计提供新思路。