Nari Labs于8月19日发布文章,介绍其为Qwen3-TTS 1.7B CustomVoice构建的服务栈,并将实现与基准一并开源。在单张H100 SXM上,每秒10个请求时首个音频的第95百分位延迟保持在50毫秒以下,即使每秒20个请求也低于100毫秒。满负荷下成本约合每百万字符语音2美元。提升来自调度而非新模型:系统的三个组件——Talker、Code Predictor和编解码器——被作为一个整体调度,而不是三条独立队列;请求按截止时间排优先级,使流式任务不必排在批量任务后面;解码则采用带缓存状态的增量方式。