Nuevos Modelos
AI Minute Newsroom
2026-08-25
Un modelo de vídeo que se dirige con las flechas del teclado mientras aún se está generando, y la empresa admite que se ve peor que los de generación diferida
Aishi Technology, la empresa china que está detrás de PixVerse, anunció R2 el 23 de agosto. Es el sucesor de R1, que en enero fue el primer modelo de vídeo que funcionaba como un flujo continuo con el que se podía interactuar, en lugar de un clip que se esperaba y luego se miraba. R2 sostiene que ese mismo bucle en tiempo real ahora se sostiene durante tramos más largos y admite más tipos de entrada a la vez. En lo arquitectónico, la compañía dice haber comprimido lo que antes era una cadena de etapas de entrenamiento en dos: un proceso autorregresivo causal omnimodal que amplía lo que el modelo del mundo puede generar, y una capa de aceleración en tiempo real que devuelve esas capacidades a velocidad interactiva. Un componente al que llama Dynamic Chunk se adapta al ritmo con que el usuario empuja: indicaciones escritas, voz o controles directos. Las demostraciones son inusualmente concretas sobre el uso previsto: moverse por una escena generada con WASD y las flechas, ramificar una historia escribiéndole, mantener una conversación con un personaje que responde en tiempo real. Aishi apunta al entretenimiento interactivo —videojuegos, ficción interactiva, emisión virtual— más que a la generación de estilo cinematográfico, y dice sin rodeos en su propia publicación que la calidad de imagen de R2 todavía queda por detrás de los mejores modelos de vídeo diferido, sobre todo en escenas complejas y en duraciones largas. No se ha anunciado fecha de lanzamiento, disponibilidad ni precio.
Por qué importaLo interesante es la renuncia que se hace a la vista de todos. Casi todos los modelos de vídeo compiten por lo bien que queda un clip terminado; este cede parte de eso a propósito para que los fotogramas sigan llegando mientras usted aún pulsa teclas, lo cual es otro producto con otra medida del éxito. Que la empresa lo diga en su propio anuncio, en lugar de afirmar ambas cosas a la vez, vale más que cualquier detalle de arquitectura. El resto, con la cautela habitual: lo publicado es una entrada de investigación y unas demostraciones, sin cifras de referencia, sin versión pública y sin precio. La generación interactiva en tiempo real es justo el tipo de capacidad que parece extraordinaria en un clip escogido y decepciona en los primeros diez minutos de uso real, y hasta que alguien ajeno a la empresa pueda mantener pulsadas las flechas un buen rato, esa diferencia queda sin medir. Merece seguimiento si trabaja cerca de los videojuegos o del vídeo: si esta clase de modelo aguanta, lo que se genera deja de ser un archivo y empieza a ser un lugar.
✓ Verificado · 2 fuentes
▶ Vídeo relacionado: PixVerse R1 — First Real-Time World Model? Infinite 1080p Video Generation Explained
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El nuevo modelo de vídeo de Alibaba acepta tu presentación como entrada y devuelve treinta segundos de película
2026-08-24Alibaba entrenó un modelo sobre un bastidor de 100 teléfonos reales: ahora completa 92 de cada 100 tareas en un móvil de verdad
2026-08-23Un modelo de ocho mil millones de parámetros que lee imágenes y las dibuja en 4K, con licencia Apache, y la comunidad lo tenía funcionando en dos días
2026-08-22Los modelos abiertos de Google se han descargado mil millones de veces, y desde fuera han construido 100.000 versiones
2026-08-22El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21