Anthropic 可解释性团队发布 2024 年 8 月 Circuits Updates
Anthropic 可解释性团队发布 2024 年 8 月 Circuits Updates,介绍词典学习特征可解释性评测、SAE 变体对比和自解释 SAE 特征三项阶段性工作。团队提出对比评测和排序评测两种量化自动可解释性方法,让 Claude 根据特征激活样例判断哪条提示词会激活该特征,并按原始平均和特征激活加权两种方式汇总得分。
推荐理由Anthropic 可解释性团队公开了 SAE 特征可解释性评测与自解释特征复现的阶段性结果,适合关注机制可解释性评测方法的研究者参考。