Recherche
AI Minute Newsroom
2026-08-10
Google a pris un modèle de langage ordinaire et lui a appris à écrire 256 mots d'un coup, pour moins d'un dixième du coût d'entraînement initial
DiffusionGemma est un modèle expérimental à poids ouverts de Google DeepMind qui ne produit pas le texte jeton après jeton. Il affine des blocs de 256 jetons en parallèle, comme un modèle de diffusion d'image rend nette l'image entière d'un seul coup, à raison d'une vingtaine de jetons par passe avant et d'environ 1 500 jetons de sortie par seconde sur une seule Nvidia H100. Le rapport technique, signé par une équipe de 43 auteurs et déposé sur arXiv le 31 juillet, avance une affirmation plus étroite et plus utile que le chiffre de vitesse. Les modèles de langage par diffusion étaient jusqu'ici traités comme une lignée à part, qu'il faut entraîner depuis zéro : c'est pourquoi presque personne n'en possède. Google n'a pas entraîné depuis zéro : il a pris Gemma 4, un modèle à mélange d'experts de 25,2 milliards de paramètres au total et 3,8 milliards actifs, et l'a converti — d'abord un affinage supervisé pour reconstruire des blocs de texte corrompus, puis une étape combinant apprentissage par renforcement et distillation d'échantillonneur — en utilisant moins de dix pour cent des jetons ayant servi au modèle d'origine. Le modèle converti conserve le mode de réflexion, l'entrée multimodale et le contexte long, et le rapport affirme qu'il bat les modèles autorégressifs en vitesse de génération même lorsque ceux-ci recourent au décodage spéculatif le plus avancé. Les poids sont sur Hugging Face sous licence Apache 2.0. L'avantage de vitesse se resserre dès qu'un serveur traite une trentaine de requêtes simultanées, c'est-à-dire le régime dans lequel vivent réellement la plupart des déploiements.
Pourquoi c'est importantPresque tous les modèles de langage que vous avez utilisés vont de gauche à droite et ne peuvent revenir sur un mot une fois posé : le modèle qui a écrit une proposition initiale fautive doit passer le reste de la phrase à faire avec. Le décodage par diffusion supprime cette contrainte : le bloc est écrit et réécrit avant que vous n'en voyiez quoi que ce soit, si bien que le modèle peut corriger ses propres erreurs précoces. Si la chose est restée une curiosité, c'est à cause du coût. Personne ne dépense un entraînement de frontière sur une architecture qui pourrait ne rien rapporter. Ce que montre ce rapport, c'est que le pari est devenu bon marché : on peut convertir un modèle qu'on possède déjà pour moins d'un dixième de ce qu'il a coûté à construire, ce qui met l'expérience à portée de tout laboratoire disposant de poids ouverts corrects — et il y en a beaucoup. La limite honnête est dans les petites lignes. L'avantage de vitesse se réduit sous charge serveur réelle : l'intérêt se concentre donc aujourd'hui là où compte la latence d'un utilisateur unique — assistants embarqués, complétion de code, tout endroit où quelqu'un attend que les mots apparaissent.
✓ Vérifié · 2 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Un modèle a appris sans la méthode qui entraîne toutes les IA.
2026-10-06Cinq problèmes ouverts sont tombés dans un chat ordinaire.
2026-10-05Les modèles bruts ont réussi des tâches que leur version polie rate.
2026-10-04Un modèle nourri de photos banales atteint 70% en raisonnement.
2026-10-04Une IA entraînée pour 8 000 dollars a battu le maître du Stratego.
2026-10-03