L'équipe Seed de ByteDance a publié mercredi SeedRealtime, un modèle qui fusionne nativement audio, vidéo et texte dans un seul système de bout en bout pour une interaction full-duplex : il continue de regarder et d'écouter même pendant qu'il parle, au lieu d'attendre son tour. L'entreprise explique qu'il lit ensemble le son, l'image et le tempo pour déterminer qui s'adresse à lui et ce qu'on lui demande ; il est déjà en service dans l'application d'assistant Doubao. Il étend au monde visuel le modèle Seeduplex d'avril, limité à la voix.