跳到正文
原文
arXiv:可解释性· arXiv:2609.01832· Fangyi Zhu·· 2026-09-02

Gemma-3-27B-PT 内部激活中的可解释抑郁症状向量

Interpretable Symptom Vectors for Depression in a Large Language Model

AI 导读

研究用机制可解释性方法分析 Gemma-3-27B-PT 的残差流,发现症状描述在第 21 层的几何分离度最高。基于临床量表构建的 Symptom Vectors 在留出自然文本上的逐症状系数,保留了临床医生标注的情绪、躯体与自杀倾向轴排序;第 21 层的单一抑郁向量可区分抑郁与非抑郁文本(AUC = 0.789),并可作为情绪效价门控限制症状投影范围。

阅读原文arxiv.org