PixVerse 背后的中国公司爱诗科技于 8 月 23 日发布 R2。它是 R1 的后继者;今年 1 月推出的 R1 是首个以可交互的连续流方式运行、而非「等待生成再观看」的视频模型。R2 宣称同一套实时循环如今能在更长的时段内保持连贯,并可同时接受更多种类的输入。在架构上,公司称已把过去一连串的训练阶段收敛为两条:一条是拓展世界模型生成上限的全模态因果自回归过程,另一条是把这些能力重新压缩回可交互速度的实时加速层。它称为 Dynamic Chunk 的组件会随用户推进的节奏自适应——文字提示、语音或直接操控。演示对目标用途的呈现异常具体:用 WASD 和方向键在生成的场景中移动、通过输入文字让剧情分叉、与实时应答的角色对话。爱诗把它对准的是互动娱乐——游戏、互动剧、虚拟直播——而非影视式生成,并在自家文章中直言:R2 的画面质量仍落后于最好的离线视频模型,在复杂场景和长时长上尤为明显。发布日期、开放范围与定价均未公布。