aiminute. ← Toute l’actu IA
Nouveaux Modèles AI Minute Newsroom 2026-08-25

Un modèle vidéo que l'on dirige aux touches fléchées pendant qu'il génère encore — et l'entreprise admet qu'il rend moins bien que les modèles hors ligne

Un modèle vidéo que l'on dirige aux touches fléchées pendant qu'il génère encore — et l'entreprise admet qu'il rend moins bien que les modèles hors ligne

Aishi Technology, l'entreprise chinoise derrière PixVerse, a annoncé R2 le 23 août. C'est le successeur de R1, qui fut en janvier le premier modèle vidéo à fonctionner comme un flux continu avec lequel on pouvait interagir, plutôt que comme un clip qu'on attendait avant de le regarder. R2 affirme que cette même boucle en temps réel tient désormais sur de plus longues durées et accepte davantage de types d'entrée à la fois. Sur le plan de l'architecture, l'entreprise dit avoir ramené à deux ce qui était auparavant une chaîne d'étapes d'entraînement : un processus autorégressif causal omnimodal qui étend ce que le modèle du monde peut générer, et une couche d'accélération en temps réel qui ramène ces capacités à une vitesse interactive. Un composant qu'elle appelle Dynamic Chunk s'adapte au rythme auquel l'utilisateur pousse : invites tapées, voix ou commandes directes. Les démonstrations sont inhabituellement concrètes sur l'usage visé : se déplacer dans une scène générée avec WASD et les flèches, faire bifurquer une histoire en lui écrivant, tenir une conversation avec un personnage qui répond en temps réel. Aishi vise le divertissement interactif — jeux, fiction interactive, diffusion virtuelle — plutôt que la génération de type cinéma, et déclare sans détour dans sa propre publication que la qualité d'image de R2 reste en retrait des meilleurs modèles vidéo hors ligne, en particulier sur les scènes complexes et sur la durée. Aucune date de sortie, disponibilité ni tarification n'a été annoncée.

Pourquoi c'est importantL'intéressant est l'arbitrage assumé au grand jour. Presque tous les modèles vidéo se disputent la beauté d'un clip fini ; celui-ci en cède volontairement une part pour que les images continuent d'arriver pendant que vous appuyez encore sur les touches, ce qui en fait un autre produit avec une autre mesure du succès. Que l'entreprise le dise dans sa propre annonce, plutôt que de revendiquer les deux à la fois, vaut davantage que n'importe quel détail d'architecture. Le reste appelle la prudence habituelle : ce qui a été publié est un billet de recherche et une série de démonstrations, sans chiffres de référence, sans version publique et sans prix. La génération interactive en temps réel est exactement le genre de capacité qui paraît extraordinaire dans un extrait choisi et déçoit dans les dix premières minutes d'usage réel, et tant que quelqu'un d'extérieur à l'entreprise n'aura pas gardé les touches fléchées enfoncées un moment, cet écart restera non mesuré. À suivre si vous travaillez près du jeu vidéo ou de la vidéo : si cette classe de modèles tient, ce qui est généré cesse d'être un fichier et commence à être un lieu.
#Vidéo

✓ Vérifié · 2 sources

▶ Vidéo associée: PixVerse R1 — First Real-Time World Model? Infinite 1080p Video Generation Explained
WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Le modèle bon marché d'OpenAI a un mode six fois plus cher.
2026-10-09
Le petit modèle de Perplexity fouille l'index du grand.
2026-10-09
Le petit modèle d'Anthropic coûte 90% moins que l'an dernier.
2026-10-08
Un modèle vidéo étiquette les images prises du point de vue du robot.
2026-10-07
Le nouveau modèle de recherche de Google tient dans 191 mégaoctets.
2026-10-07