跳到正文

红队 · 精选

10月9日 · 周五

红队 · 精选

今天还没有新的精选
10月8日周四
  1. Anthropic Alignment Science · 49

    Anthropic 用真实部署资源提升编码审计真实性

    Anthropic 对齐科学团队提出 realism win rate 指标,用 LLM 裁判在成对比较中判断审计记录与真实部署记录哪个更真实,以此衡量自动化审计的真实性。研究为 Petri 审计智能体提供真实的 system prompt、工具定义和代码库资源,在 5 个奖励作弊审计场景中把平均真实度胜率从 4.6% 提升到 32.8%,且未显著改变奖励作弊率。在良性编码任务上资源同样稳定提升真实性,但在涉及关停抵抗的高风险场景中,改写种子指令比提供资源更能提升真实性,说明任务本身而非环境是主要瓶颈。该功能已上线 Petri。

10月2日周五
  1. FAR.AI · 43

    FAR.AI 研究:对抗鲁棒性会随模型规模提升吗

    FAR.AI 系统研究了不同规模 LLM 的对抗鲁棒性,发现未做对抗训练的模型鲁棒性随规模提升很弱且噪声很大,而对抗训练后规模效应明显。研究用 Pythia 系列模型(7M 到 1B 参数)替换 unembedding 层为分类头,在 IMDB、Spam、PasswordMatch、WordLength 四个二分类任务上微调,并用 GCG 和 RandomToken 两种对抗后缀攻击各追加 10 个 token 进行评估。未防御模型虽整体上越大越鲁棒,但训练 checkpoint 和随机种子带来的波动可超过模型规模翻倍甚至十倍的影响。对抗训练后,更大模型样本效率更高、收敛到更低的攻击成功率,且对更强或不同方法的攻击出现鲁棒性迁移,但迁移只在足够大的模型上成立。作者指出这只是初步结果,仅覆盖两个数量级,未来将扩展到生成任务和前沿模型。

  2. Thinking Machines · 43

    Thinking Machines 提出开源权重模型的安全发布路径

    Thinking Machines 发布文章阐述开源权重模型的安全发布路径,并说明其近期开源的 Inkling 与 Inkling-Small 的评估依据。文章主张安全发布取决于模型本身与所处生态:对模型做稳健安全测试,并研究能否通过预训练数据筛选或后训练干预把危险能力与通用智能解耦;对生态则通过分阶段发布、支持防御方和与安全研究者合作来提升韧性。Inkling 的评估包括覆盖 CBRN 与攻击性网络安全等领域的内部评测、四家外部机构的红队测试(Scale AI、Handshake AI、FAR.AI、Apollo Research),以及去除拒答行为的对抗微调实验;结果显示两个模型未扩展危险能力前沿,也未显著扩大相关能力的可及性。文章还提出从受监控 API 访问、托管微调到开放权重的分阶段路径,并计划发布更详细的评估、准入标准与停止条件框架,同时将推出 Tinker 安全资助。

10月1日周四
  1. Transformer Circuits · 42

    Anthropic 可解释性团队:用字典学习特征训练分类器

    Anthropic 可解释性团队报告了用字典学习提取的特征替代原始激活训练生物武器有害/无害分类器的初步实验。在合成数据上,线性特征分类器与原始激活分类器表现相当甚至略优,用 max-pooling 聚合整个上下文窗口的特征激活是关键;在跨语言和 base64 等编码的分布外数据集 synthetic_3 上,特征分类器的 ROC_AUC 为 0.96,原始激活为 0.9。基于特征激活的决策树性能弱于线性分类器,但更易解读。特征可视化还能发现数据集中的伪相关,例如一个预测无害的特征会因学术出版格式文本而激活,作者据此构造的对抗后缀让 300 条有害提示中的绝大多数被误判为无害,而用原始激活系数构造的类似攻击效果差得多。

  2. Goodfire Research · 55

    Goodfire 提出模型差分放大方法,用于发现微调后罕见不良行为

    Goodfire Research 提出模型差分放大(model diff amplification,后称 logit diff amplification)方法,通过 logits_amplified = logits_after + α(logits_after – logits_before) 采样下一个 token,放大微调前后模型的差异,从而用更少 rollout 暴露罕见不良行为。在涌现性错位案例中,用不同比例不良医疗建议数据微调 Llama 3.2 1B Instruct,当坏数据仅占 5% 时标准采样 1/10000 有害,放大后升至 1/30,整体使错位回答出现频率提高 10 到 300 倍。

已经到底了