跳到正文
原文
arXiv:可解释性· arXiv:2609.04276· Jie Ma·· 29 天前

FailSAE:用稀疏自编码器实现视觉语言模型的可解释失败预测

FailSAE: Towards Interpretable Failure Prediction for Vision-Language Models via Sparse Autoencoders

AI 导读

研究提出 FailSAE,用稀疏自编码器(SAE)对 CLIP 等视觉语言模型做可解释的失败预测,将失败预测建模为 SAE 稀疏隐激活上的分类任务,并设计三阶段失败感知训练流程。实验显示该框架在失败预测上优于所评估的基线,失败感知训练使 SAE 隐方向捕获更多类别特定概念。分析还发现模型失败时表征从类别特定概念转向更模糊或风格相关概念,并探索了用学到的 SAE 隐方向支持运行时失败恢复。

阅读原文arxiv.org