总部位于上海的MiniMax于7月31日发布H3:该模型把文本、图像、视频和音频作为一个整体输入来理解,生成5至15秒、最高2K分辨率、24fps的视频片段——人声、音效和音乐与画面同步生成为原生立体声,而非事后配上。它还能编辑已有素材,并在视频之间迁移动作。MiniMax称2K生成成本不到主流对手的三分之一,并表示将在'未来几天'开放模型权重。
✓ 已核实 · 3个来源