Gemini 3.1 Flash TTS 发布:支持音频标签的可控语音生成
Gemini 3.1 Flash TTS: the next generation of expressive AI speech
AI 导读
Google DeepMind 推出 Gemini 3.1 Flash TTS,一款支持音频标签(audio tags)的文本转语音模型,可通过自然语言指令控制语音风格、语速与表达方式。该模型在 Artificial Analysis TTS 排行榜上取得 1,211 Elo 分数,支持 70 多种语言和原生多说话人对话,并已通过 Gemini API、Google AI Studio、Vertex AI 和 Workspace 的 Google Vids 逐步开放预览。所有生成音频均嵌入 SynthID 水印以支持 AI 内容检测。