LLM 如何表征与检索单复数实体:复指回指的机制可解释性研究
A Circuit for Plural Reference: How LLMs Represent and Retrieve Singular and Plural Entities
AI 导读
研究用机制可解释性与注意力模式分析,考察 LLM 预测代词回指前文实体时如何表征和检索单复数实体。通过多种因果干预手段,识别出一组注意力头,分别负责在输入中表征共指信息、识别构成复数指代的实体,以及把信息传递给负责选择先行词并预测代词的组件。研究还发现 LLM 在复数代词偏好上与人类一致:本体上相似、并由 "and" 连接的实体更可能被复数指代。