跳到正文
原文
Failure-First·· 2026-08-31

机器人系统集成端侧语音识别模型的调查:从云端 API 转向本地化

[Daily Paper] Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

AI 导读

针对现代人机交互中云端 ASR API 带来的延迟、隐私与可靠性风险,Li 等人的 2026 年综述梳理了将语音识别迁移到机器人的端侧方案,并以“失败优先”视角指出上游误识别会沿感知管线传播并引发下游具身行动失效。文中对比了 OpenAI Whisper(68 万小时数据)、CMU OWSM v3.1 与 OWSM-CTC、Meta MMS(覆盖超 1000 种语言)及 Julius 等语音基础模型,以及 Kaldi、ESPnet、SpeechBrain 生态中的 LibriSpeech、CommonVoice、Gigaspeech 数据集。

阅读原文failurefirst.org