跳到正文
原文
arXiv:可解释性· arXiv:2610.08887· Pulak Kuli·本站收录 · 原文发表 日期未标

Moshi 全双工语音模型的情感引导遵循几何结构而非标签

Steering Follows Geometry, Not Labels: Emotion Directions in a Full-Duplex Speech Model

AI 导读

研究者在全开源全双工语音语言模型 Moshi 上测试了四种情感(happy、angry、surprise、sad)的激活引导,采用均值差激活引导,每帧仅需少量向量加法且无需重训练。结果显示情感可从 Moshi 的残差流中线性解码,但激活引导仅部分可行且不均衡:happy、angry、surprise 引导向共享方向,而 sad 可被独立引导,且该共享成分无法被等量地从所有情感中投影剔除。

阅读原文arxiv.org