ElevenLabs周一发布了Eleven v4,一个能从文字里读出语气和情绪的语音模型。用十秒录音克隆的声音,可以说九十多种语言,听起来像本地人。Turbo版本在收到请求约150毫秒后开口,供实时语音助手使用。
✓ 已核实 · 2个来源