Nouveaux Modèles
2026-08-05
SeedRealtime de ByteDance regarde, écoute et parle — tout en même temps
L'équipe Seed de ByteDance a publié mercredi SeedRealtime, un modèle qui fusionne nativement audio, vidéo et texte dans un seul système de bout en bout pour une interaction full-duplex : il continue de regarder et d'écouter même pendant qu'il parle, au lieu d'attendre son tour. L'entreprise explique qu'il lit ensemble le son, l'image et le tempo pour déterminer qui s'adresse à lui et ce qu'on lui demande ; il est déjà en service dans l'application d'assistant Doubao. Il étend au monde visuel le modèle Seeduplex d'avril, limité à la voix.
Pourquoi c'est importantLa voix full-duplex était la première étape ; ajouter des yeux rapproche l'assistant IA de quelqu'un présent dans la pièce plutôt que d'un talkie-walkie. Que ByteDance l'intègre directement à son assistant grand public phare montre que l'interaction multimodale en temps réel devient le prochain champ de bataille des applications d'IA.
✓ Vérifié · 2 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Apple Music indiquera quand un morceau a été fait par une machine — mais c'est celui qui le publie qui décide de le dire
2026-08-21Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21Adobe génère désormais la musique, la voix off et le claquement de porte — et affirme que la licence vous couvre
2026-08-21Montrez-le au robot une fois — de trois à douze secondes — et il réussit 59 fois sur 100 sans le moindre entraînement
2026-08-21Il y a six mois, Hollywood adressait une mise en demeure à ByteDance. Cette semaine, les deux camps ont signé une trêve — sans qu'un dollar change de mains.
2026-08-20