Neue Modelle
2026-08-05
ByteDances SeedRealtime schaut, hört und spricht — alles gleichzeitig
ByteDances Seed-Team hat am Mittwoch SeedRealtime veröffentlicht: ein Modell, das Audio, Video und Text nativ in einem durchgängigen System für Full-Duplex-Interaktion verschmilzt. Es schaut und hört weiter zu, während es spricht, statt sich abzuwechseln. Nach Angaben des Unternehmens liest es Ton, Bild und Timing gemeinsam, um zu erkennen, wer es anspricht und was gewünscht wird; in der Assistenten-App Doubao ist es bereits im Einsatz. Damit wird das nur sprachbasierte Seeduplex-Modell vom April in die visuelle Welt erweitert.
Warum es wichtig istFull-Duplex-Sprache war der erste Schritt; mit Augen verhält sich ein KI-Assistent weniger wie ein Walkie-Talkie und mehr wie jemand im Raum. Dass ByteDance das direkt in seinen wichtigsten Verbraucher-Assistenten bringt, zeigt: Multimodale Echtzeit-Interaktion wird das nächste Schlachtfeld der KI-Apps.
✓ Verifiziert · 2 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Apple Music zeigt künftig an, wenn ein Song von einer Maschine stammt — ob das jemand angibt, entscheidet der Uploader
2026-08-21DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21Adobe erzeugt jetzt die Musik, die Sprecherstimme und das zuschlagende Türgeräusch — und sagt, die Lizenz decke Sie ab
2026-08-21Einmal vormachen — drei bis zwölf Sekunden — und der Roboter erledigt die Aufgabe ganz ohne Training 59 von 100 Mal richtig
2026-08-21Vor sechs Monaten schickte Hollywood ByteDance eine Unterlassungsaufforderung. Diese Woche unterzeichneten beide einen Waffenstillstand — und es floss kein Geld.
2026-08-20