PixVerse を手がける中国企業・爱诗科技(Aishi Technology)は8月23日に R2 を発表した。1月に登場した R1 の後継である。R1 は、待ってから見るクリップではなく、対話できる連続ストリームとして動く初めての動画モデルだった。R2 の主張は、同じリアルタイムのループがより長い時間にわたって破綻せず持ち、同時により多様な入力を受け取れるようになったというものだ。アーキテクチャについて同社は、かつて連なっていた学習段階を二つに畳んだと述べる。ひとつは世界モデルが生成できる範囲を広げるオムニ因果自己回帰プロセス、もうひとつはその能力を対話可能な速度へ圧し戻すリアルタイム加速層である。Dynamic Chunk と呼ぶ構成要素は、ユーザーがどれだけ速く操作しているか——打ち込むプロンプト、音声、直接操作——に適応する。デモは想定用途について異例なほど具体的だ。生成された場面を WASD と方向キーで移動する、文字を打ち込んで物語を分岐させる、リアルタイムで応答するキャラクターと会話する。爱诗科技が狙うのは映画的な生成ではなく、インタラクティブ・エンターテインメント——ゲーム、インタラクティブドラマ、バーチャル配信——であり、自社の記事の中で、R2 の画質はとりわけ複雑な場面や長時間において最良のオフライン動画モデルに劣ると率直に述べている。公開時期、提供範囲、価格はいずれも未発表である。