据动察 Beating 监测,Cartesia 发布新一代实时语音合成模型 Sonic 3.6,目前已开放 Beta。模型支持 44 种语言,并同时拿下 Artificial Analysis 两个 TTS 榜单第一。
Provider Voice 使用各家模型自己的原生声音盲测,Sonic 3.6 排在阿里 Qwen-Audio-3.0-TTS-Plus、SpeechifyAI Simba 3.2 和谷歌 Gemini 3.1 Flash TTS 前面。Controlled Voice 则让所有模型使用同一组克隆声音,更侧重比较模型本身,Sonic 3.6 依然第一。
Artificial Analysis 测得 Sonic 3.6 生成速度为每秒 136.1 个字符,ElevenLabs Eleven v3 为 46.7,Gemini 3.1 Flash TTS 为 24.2。
价格为每百万字符 49 美元,不到 Eleven v3 的一半,但仍高于 Qwen 的 27.6 美元和 Simba 3.2 的 10 美元。
