aiminute. ← Toute l’actu IA
Nouveaux Modèles AI Minute Newsroom 2026-08-25

Un modèle vidéo que l'on dirige aux touches fléchées pendant qu'il génère encore — et l'entreprise admet qu'il rend moins bien que les modèles hors ligne

Un modèle vidéo que l'on dirige aux touches fléchées pendant qu'il génère encore — et l'entreprise admet qu'il rend moins bien que les modèles hors ligne

Aishi Technology, l'entreprise chinoise derrière PixVerse, a annoncé R2 le 23 août. C'est le successeur de R1, qui fut en janvier le premier modèle vidéo à fonctionner comme un flux continu avec lequel on pouvait interagir, plutôt que comme un clip qu'on attendait avant de le regarder. R2 affirme que cette même boucle en temps réel tient désormais sur de plus longues durées et accepte davantage de types d'entrée à la fois. Sur le plan de l'architecture, l'entreprise dit avoir ramené à deux ce qui était auparavant une chaîne d'étapes d'entraînement : un processus autorégressif causal omnimodal qui étend ce que le modèle du monde peut générer, et une couche d'accélération en temps réel qui ramène ces capacités à une vitesse interactive. Un composant qu'elle appelle Dynamic Chunk s'adapte au rythme auquel l'utilisateur pousse : invites tapées, voix ou commandes directes. Les démonstrations sont inhabituellement concrètes sur l'usage visé : se déplacer dans une scène générée avec WASD et les flèches, faire bifurquer une histoire en lui écrivant, tenir une conversation avec un personnage qui répond en temps réel. Aishi vise le divertissement interactif — jeux, fiction interactive, diffusion virtuelle — plutôt que la génération de type cinéma, et déclare sans détour dans sa propre publication que la qualité d'image de R2 reste en retrait des meilleurs modèles vidéo hors ligne, en particulier sur les scènes complexes et sur la durée. Aucune date de sortie, disponibilité ni tarification n'a été annoncée.

Pourquoi c'est importantL'intéressant est l'arbitrage assumé au grand jour. Presque tous les modèles vidéo se disputent la beauté d'un clip fini ; celui-ci en cède volontairement une part pour que les images continuent d'arriver pendant que vous appuyez encore sur les touches, ce qui en fait un autre produit avec une autre mesure du succès. Que l'entreprise le dise dans sa propre annonce, plutôt que de revendiquer les deux à la fois, vaut davantage que n'importe quel détail d'architecture. Le reste appelle la prudence habituelle : ce qui a été publié est un billet de recherche et une série de démonstrations, sans chiffres de référence, sans version publique et sans prix. La génération interactive en temps réel est exactement le genre de capacité qui paraît extraordinaire dans un extrait choisi et déçoit dans les dix premières minutes d'usage réel, et tant que quelqu'un d'extérieur à l'entreprise n'aura pas gardé les touches fléchées enfoncées un moment, cet écart restera non mesuré. À suivre si vous travaillez près du jeu vidéo ou de la vidéo : si cette classe de modèles tient, ce qui est généré cesse d'être un fichier et commence à être un lieu.
#Vidéo

✓ Vérifié · 2 sources

▶ Vidéo associée: PixVerse R1 — First Real-Time World Model? Infinite 1080p Video Generation Explained
WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Le nouveau modèle vidéo d'Alibaba prend votre présentation en entrée et rend trente secondes de film
2026-08-24
Alibaba a entraîné un modèle sur un rack de 100 téléphones réels — il termine désormais 92 tâches sur 100 sur un vrai appareil
2026-08-23
Un modèle de huit milliards de paramètres qui lit les images et les dessine en 4K, sous licence Apache — la communauté le faisait tourner en deux jours
2026-08-22
Les modèles ouverts de Google ont été téléchargés un milliard de fois, et l'extérieur en a fabriqué 100 000 versions
2026-08-22
Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21