小米上周五发布了免费的 CocktailASR-1 语音模型。你给它一段目标说话人的声音样本,它就把其他人当作背景忽略。三人混说时它的词错率是 12.29%,两人混说时是 4.11%。
✓ 已核实 · 3个来源