aiminute. ← 全部AI新闻
工具 2026-08-22

一个在50毫秒内就开口说话的语音模型,而且服务端代码是开源的

一个在50毫秒内就开口说话的语音模型,而且服务端代码是开源的

Nari Labs于8月19日发布文章,介绍其为Qwen3-TTS 1.7B CustomVoice构建的服务栈,并将实现与基准一并开源。在单张H100 SXM上,每秒10个请求时首个音频的第95百分位延迟保持在50毫秒以下,即使每秒20个请求也低于100毫秒。满负荷下成本约合每百万字符语音2美元。提升来自调度而非新模型:系统的三个组件——Talker、Code Predictor和编解码器——被作为一个整体调度,而不是三条独立队列;请求按截止时间排优先级,使流式任务不必排在批量任务后面;解码则采用带缓存状态的增量方式。

为什么重要?延迟决定了语音界面感觉像对话还是像电话语音菜单。在大约200毫秒以内,人会把回复当作回答;超过半秒,人就开始抢话。此前要做到50毫秒以内,通常意味着采用某家语音API公司的专有栈,并支付相应价格。过去两年重塑文本推理的那个诀窍——大部分速度其实藏在服务层而非权重里——如今来到了音频领域,公开发布并附上代码。如果你在做任何会说话的东西,可接受的下限刚刚被抬高了。
#音频与音乐

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

Anthropic 让自家最强模型去你的代码里找漏洞,但不让你跟它说话
2026-08-22
Apple Music 将标注哪些歌曲由机器生成——但要不要说,取决于上传者
2026-08-21
Stripe 刚以75亿美元买下一个模型路由器。几天后,Ramp 自己造了一个,并且免费送到一月。
2026-08-21
Meta 的助手现在是一款 Mac 应用,能读你的屏幕、往任何窗口里打字——而它看到的东西可以用来训练模型
2026-08-21
在新闻网站上点一下,就等于告诉谷歌"多给我看这家"——而且你不用离开正在读的页面
2026-08-21