Moshi 全双工语音模型的情感引导遵循几何结构而非标签
Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model
AI 导读
研究者在全开源全双工语音语言模型 Moshi 上测试了四种情感(happy、angry、surprise、sad)的激活引导,采用均值差激活引导,每帧仅需少量向量加法且无需重训练。结果显示情感可从 Moshi 的残差流中线性解码,但激活引导仅部分可行且不均衡:happy、angry、surprise 引导向共享方向,而 sad 可被独立引导,且该共享成分无法被等量地从所有情感中投影剔除。