可解释性arXiv 2609.35367
DAFI:面向 SAE 特征双端解释的智能体方法
提出 DAFI,把 SAE 特征解释为输入、输出与功能三元组
- arXiv
- 2609.35367
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Claude Code、Gemma-2-2B、Gemma-2-9B 等 6 个
摘要DAFI 用三项假设和可迁移技能解释 SAE 特征,并发现多数可靠端点语义并不等价。
DAFI 把单个 SAE 特征解释成输入激活语义、干预输出偏向,以及二者之间的功能映射,并由智能体按分项诊断修订。