aiminute. ← 全部AI新闻
工具 AI Minute Newsroom 2026-08-22

一个在50毫秒内就开口说话的语音模型,而且服务端代码是开源的

一个在50毫秒内就开口说话的语音模型,而且服务端代码是开源的

Nari Labs于8月19日发布文章,介绍其为Qwen3-TTS 1.7B CustomVoice构建的服务栈,并将实现与基准一并开源。在单张H100 SXM上,每秒10个请求时首个音频的第95百分位延迟保持在50毫秒以下,即使每秒20个请求也低于100毫秒。满负荷下成本约合每百万字符语音2美元。提升来自调度而非新模型:系统的三个组件——Talker、Code Predictor和编解码器——被作为一个整体调度,而不是三条独立队列;请求按截止时间排优先级,使流式任务不必排在批量任务后面;解码则采用带缓存状态的增量方式。

为什么重要?延迟决定了语音界面感觉像对话还是像电话语音菜单。在大约200毫秒以内,人会把回复当作回答;超过半秒,人就开始抢话。此前要做到50毫秒以内,通常意味着采用某家语音API公司的专有栈,并支付相应价格。过去两年重塑文本推理的那个诀窍——大部分速度其实藏在服务层而非权重里——如今来到了音频领域,公开发布并附上代码。如果你在做任何会说话的东西,可接受的下限刚刚被抬高了。
#音频与音乐

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

TikTok把购物机器人放进了你正在看的视频里。
2026-10-06
微软的新模型在你说完之前就开始写字了。
2026-10-05
ElevenLabs给学生免费送一年的朗读声音。
2026-10-05
Meta的助手给你生活里每个人都建了按小时更新的档案。
2026-10-05
一条命令就把苹果删掉的 AI 关闭开关找回来
2026-10-05