字节跳动 Seed 团队周三发布了 SeedRealtime——一个在端到端系统中原生融合音频、视频与文本的全双工交互模型:它在说话的同时仍在观察和倾听,而不是轮流对话。公司称,模型会综合声音、画面与时序信息,判断谁在对它说话、想要什么,目前已在豆包助手应用中上线。它把 4 月发布的纯语音模型 Seeduplex 扩展到了视觉世界。
✓ 已核实 · 2个来源