El equipo Seed de ByteDance lanzó el miércoles SeedRealtime, un modelo que fusiona de forma nativa audio, video y texto en un único sistema de extremo a extremo para la interacción full-duplex: sigue mirando y escuchando incluso mientras habla, en lugar de esperar turnos. La empresa dice que interpreta juntos el sonido, las imágenes y los tiempos para deducir quién se dirige a él y qué quiere, y ya funciona en la app de asistente Doubao. Extiende al mundo visual el modelo Seeduplex de abril, que era solo de voz.