跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.12623· Utkarsh Tyagi·· 21 天前

SteerDuplex:可操控的全双工语音对话模型

SteerDuplex: Steerable Duplex Speech Dialogue Models

AI 导读

SteerDuplex 是一个基于 Moshi 微调的全双工语音对话模型,通过自然对话与合成对话训练提升指令跟随、发声表现与双工交互能力,并采用两阶段强化学习结合可验证交互检查与评判式语义反馈优化时序与响应连续性。团队同时提出 SteerBench 基准,含 390 条语音提示和 1,067 条人工编写的音频与文本评分标准,覆盖语气、人设、风格/口音和语速/长度。

阅读原文arxiv.org