Nuevos Modelos
AI Minute Newsroom
2026-08-25
Un modelo de vídeo que se dirige con las flechas del teclado mientras aún se está generando, y la empresa admite que se ve peor que los de generación diferida
Aishi Technology, la empresa china que está detrás de PixVerse, anunció R2 el 23 de agosto. Es el sucesor de R1, que en enero fue el primer modelo de vídeo que funcionaba como un flujo continuo con el que se podía interactuar, en lugar de un clip que se esperaba y luego se miraba. R2 sostiene que ese mismo bucle en tiempo real ahora se sostiene durante tramos más largos y admite más tipos de entrada a la vez. En lo arquitectónico, la compañía dice haber comprimido lo que antes era una cadena de etapas de entrenamiento en dos: un proceso autorregresivo causal omnimodal que amplía lo que el modelo del mundo puede generar, y una capa de aceleración en tiempo real que devuelve esas capacidades a velocidad interactiva. Un componente al que llama Dynamic Chunk se adapta al ritmo con que el usuario empuja: indicaciones escritas, voz o controles directos. Las demostraciones son inusualmente concretas sobre el uso previsto: moverse por una escena generada con WASD y las flechas, ramificar una historia escribiéndole, mantener una conversación con un personaje que responde en tiempo real. Aishi apunta al entretenimiento interactivo —videojuegos, ficción interactiva, emisión virtual— más que a la generación de estilo cinematográfico, y dice sin rodeos en su propia publicación que la calidad de imagen de R2 todavía queda por detrás de los mejores modelos de vídeo diferido, sobre todo en escenas complejas y en duraciones largas. No se ha anunciado fecha de lanzamiento, disponibilidad ni precio.
Por qué importaLo interesante es la renuncia que se hace a la vista de todos. Casi todos los modelos de vídeo compiten por lo bien que queda un clip terminado; este cede parte de eso a propósito para que los fotogramas sigan llegando mientras usted aún pulsa teclas, lo cual es otro producto con otra medida del éxito. Que la empresa lo diga en su propio anuncio, en lugar de afirmar ambas cosas a la vez, vale más que cualquier detalle de arquitectura. El resto, con la cautela habitual: lo publicado es una entrada de investigación y unas demostraciones, sin cifras de referencia, sin versión pública y sin precio. La generación interactiva en tiempo real es justo el tipo de capacidad que parece extraordinaria en un clip escogido y decepciona en los primeros diez minutos de uso real, y hasta que alguien ajeno a la empresa pueda mantener pulsadas las flechas un buen rato, esa diferencia queda sin medir. Merece seguimiento si trabaja cerca de los videojuegos o del vídeo: si esta clase de modelo aguanta, lo que se genera deja de ser un archivo y empieza a ser un lugar.
✓ Verificado · 2 fuentes
▶ Vídeo relacionado: PixVerse R1 — First Real-Time World Model? Infinite 1080p Video Generation Explained
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El modelo barato de OpenAI ya tiene un modo seis veces más caro.
2026-10-09El modelo pequeño de Perplexity busca en el índice del grande.
2026-10-09El nuevo modelo pequeño de Anthropic cuesta 90% menos que antes.
2026-10-08Un modelo etiqueta el vídeo grabado desde la vista del robot.
2026-10-07El nuevo modelo de búsqueda de Google cabe en 191 megabytes.
2026-10-07