SAE 潜空间中词性作为涌现类别:LLM 形态句法信息呈分布式编码
Parts-of-Speech as Emergent Categories in SAE Latent Space
AI 导读
研究以词性(PoS)为受控测试用例,考察 Sparse AutoEncoder(SAE)潜变量暴露的语言结构。结果显示词性区分可从 SAE 激活中高度恢复,但不与潜变量形成一对一映射,且无法还原为词汇记忆;开放与封闭词类差异显著。词性类别由紧凑的稀疏潜变量组支撑,各组在留出数据上保持稳定,相关类别之间存在重叠,表明 SAE 以分布式、依赖类别的方式定位形态句法信息,而非原子式语法特征。