aiminute. ← 全部AI新闻
新模型 AI Minute Newsroom 2026-08-25

一个在生成过程中就能用方向键操控的视频模型——而公司自己承认,它画质不如离线模型

一个在生成过程中就能用方向键操控的视频模型——而公司自己承认,它画质不如离线模型

PixVerse 背后的中国公司爱诗科技于 8 月 23 日发布 R2。它是 R1 的后继者;今年 1 月推出的 R1 是首个以可交互的连续流方式运行、而非「等待生成再观看」的视频模型。R2 宣称同一套实时循环如今能在更长的时段内保持连贯,并可同时接受更多种类的输入。在架构上,公司称已把过去一连串的训练阶段收敛为两条:一条是拓展世界模型生成上限的全模态因果自回归过程,另一条是把这些能力重新压缩回可交互速度的实时加速层。它称为 Dynamic Chunk 的组件会随用户推进的节奏自适应——文字提示、语音或直接操控。演示对目标用途的呈现异常具体:用 WASD 和方向键在生成的场景中移动、通过输入文字让剧情分叉、与实时应答的角色对话。爱诗把它对准的是互动娱乐——游戏、互动剧、虚拟直播——而非影视式生成,并在自家文章中直言:R2 的画面质量仍落后于最好的离线视频模型,在复杂场景和长时长上尤为明显。发布日期、开放范围与定价均未公布。

为什么重要?有意思的地方在于这次公开做出的取舍。几乎所有视频模型都在比拼成片好不好看;这一个则有意让出部分画质,以便在你还在按键时画面持续产出——这是一种成功标准完全不同的产品。公司在自家公告中直接这么说,而不是宣称两者兼得,这一点比任何架构细节都更有分量。其余部分请照例保持谨慎:目前公布的是一篇研究文章和一组演示,没有基准分数,没有公开版本,也没有价格。实时交互生成恰恰属于那类在精选片段里惊艳、在实际上手的头十分钟里让人失望的能力;在公司之外的人能持续按住方向键试上一阵之前,这道落差无从衡量。如果你的工作与游戏或视频沾边,值得关注:倘若这一类模型真能站得住,那么被生成出来的东西就不再是一个文件,而开始成为一个地方。
#视频

✓ 已核实 · 2个来源

▶ 相关视频: PixVerse R1 — First Real-Time World Model? Infinite 1080p Video Generation Explained
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

阿里巴巴的新视频模型可以直接吃下你的幻灯片,吐出三十秒成片
2026-08-24
阿里巴巴用一整架100部真实手机训练模型——如今在真机上100个任务能完成92个
2026-08-23
一个 80 亿参数的模型,既能看图又能画图,还支持原生 4K,采用 Apache 许可——社区两天就跑起来了
2026-08-22
谷歌的开放模型已被下载十亿次,外部开发者做出了10万个版本
2026-08-22
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21