aiminute. ← 全部AI新闻
新模型 AI Minute Newsroom 2026-09-14

小米的开源模型能在三人同时说话时只认准一个人

小米的开源模型能在三人同时说话时只认准一个人

小米上周五发布了免费的 CocktailASR-1 语音模型。你给它一段目标说话人的声音样本,它就把其他人当作背景忽略。三人混说时它的词错率是 12.29%,两人混说时是 4.11%。

为什么重要?两个人一开口叠在一起,会议纪要和字幕就全乱了。权重公开,意味着这件事可以在你自己的机器上跑,而不是公司的服务器。
#音频与音乐

✓ 已核实 · 3个来源

▶ 相关视频: Solving the Cocktail Party Problem with Deep Learning (In-depth version)
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

DeepSeek 正在小范围测试它的第一个语音功能
2026-09-14
ElevenLabs新音乐模型让免费用户也能卖自己的歌。
2026-09-13
一家中国零售商开源了边走边生成世界的模型。
2026-09-13
Kimi便宜的编程模型把百万上下文开放给所有人
2026-09-12
一家中国地图公司造出了可以飞进去的三维世界。
2026-09-11