ByteDance の Seed チームは水曜日、SeedRealtime を公開した。音声・映像・テキストをエンドツーエンドの単一システムでネイティブに融合した全二重(フルデュプレックス)対話モデルで、順番を待つのではなく、話している間も見続け、聞き続ける。同社によれば、音・映像・タイミングを合わせて読み取り、誰が話しかけているのか、何を求めているのかを判断する。すでにアシスタントアプリ「豆包(Doubao)」で稼働中だ。4月公開の音声のみのモデル Seeduplex を視覚の世界へ拡張したものとなる。