评测与基准arXiv 2609.09113
SAEScientist-Bench:AI 智能体能否自主开展 SAE 可解释性研究
提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征
- arXiv
- 2609.09113
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Gemini 3.8 Flash、Gemma-2-9B-IT、Kimi K3 等 12 个
摘要SAEScientist-Bench 显示前沿智能体能找到选择性 SAE 特征,但因果 steering 仍明显低于 Expert。
SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。