跳到正文

#Google DeepMind

今天收录 1 条

第 6 页更新的内容回到最新

6月28日周五
  1. Transformer Circuits(Anthropic 可解释性) · · 原文 62

    Anthropic 可解释性团队 2024 年 6 月更新:TopK 与 Gated SAE 对比及外部评测进展

    Anthropic 可解释性团队发布 2024 年 6 月更新,汇总多项尚在成形的研究想法。团队复现了 TopK SAE 与 Gated SAE 相对标准 L1 惩罚 SAE 的改进,确认二者在 L0/MSE 权衡上表现相近且明显更优,但训练优化程度低于标准 SAE。在 100 个特征的盲评中,不同方法在单义性上未见明显差异;高密度特征在低 L0 下不构成病理问题,但在 K=100 时出现大量难以解释的高密度特征。Clerp 自动评测显示 Gated SAE 与 K=20 TopK SAE 的得分与 L1=10 标准 SAE 相当。

    推荐理由Anthropic 可解释性团队汇总 SAE 训练方法的复现结果与外部评测进展,适合跟进稀疏自编码器路线的人了解当前共识与未解问题。

5月21日周二
  1. 雷峰网安全频道 ·

    亚信安全发布安全大模型信立方,用AI对抗AI攻击

    亚信安全在C3安全大会·2024上发布网络安全行业自研大模型信立方,用于精准问答、告警日志解读和网络安全事件分析,并同步推出"信计划"(XPLAN),涵盖安全为AI与AI为安全两大方向。亚信安全高级副总裁陈奋透露,针对大模型的攻击手段一年内已涌现数十种,其团队在Llama2环境模拟海绵样本攻击,使模型响应从几秒延迟至60秒以上、慢了20倍以上。信计划已落地东数西算成都节点的算力云安全保护,并通过红队测试从八个方向为大模型提供上线前安全检查。

已经到底了