aiminute. ← Toute l’actu IA
Recherche 2026-08-10

Google a pris un modèle de langage ordinaire et lui a appris à écrire 256 mots d'un coup, pour moins d'un dixième du coût d'entraînement initial

Google a pris un modèle de langage ordinaire et lui a appris à écrire 256 mots d'un coup, pour moins d'un dixième du coût d'entraînement initial

DiffusionGemma est un modèle expérimental à poids ouverts de Google DeepMind qui ne produit pas le texte jeton après jeton. Il affine des blocs de 256 jetons en parallèle, comme un modèle de diffusion d'image rend nette l'image entière d'un seul coup, à raison d'une vingtaine de jetons par passe avant et d'environ 1 500 jetons de sortie par seconde sur une seule Nvidia H100. Le rapport technique, signé par une équipe de 43 auteurs et déposé sur arXiv le 31 juillet, avance une affirmation plus étroite et plus utile que le chiffre de vitesse. Les modèles de langage par diffusion étaient jusqu'ici traités comme une lignée à part, qu'il faut entraîner depuis zéro : c'est pourquoi presque personne n'en possède. Google n'a pas entraîné depuis zéro : il a pris Gemma 4, un modèle à mélange d'experts de 25,2 milliards de paramètres au total et 3,8 milliards actifs, et l'a converti — d'abord un affinage supervisé pour reconstruire des blocs de texte corrompus, puis une étape combinant apprentissage par renforcement et distillation d'échantillonneur — en utilisant moins de dix pour cent des jetons ayant servi au modèle d'origine. Le modèle converti conserve le mode de réflexion, l'entrée multimodale et le contexte long, et le rapport affirme qu'il bat les modèles autorégressifs en vitesse de génération même lorsque ceux-ci recourent au décodage spéculatif le plus avancé. Les poids sont sur Hugging Face sous licence Apache 2.0. L'avantage de vitesse se resserre dès qu'un serveur traite une trentaine de requêtes simultanées, c'est-à-dire le régime dans lequel vivent réellement la plupart des déploiements.

Pourquoi c'est importantPresque tous les modèles de langage que vous avez utilisés vont de gauche à droite et ne peuvent revenir sur un mot une fois posé : le modèle qui a écrit une proposition initiale fautive doit passer le reste de la phrase à faire avec. Le décodage par diffusion supprime cette contrainte : le bloc est écrit et réécrit avant que vous n'en voyiez quoi que ce soit, si bien que le modèle peut corriger ses propres erreurs précoces. Si la chose est restée une curiosité, c'est à cause du coût. Personne ne dépense un entraînement de frontière sur une architecture qui pourrait ne rien rapporter. Ce que montre ce rapport, c'est que le pari est devenu bon marché : on peut convertir un modèle qu'on possède déjà pour moins d'un dixième de ce qu'il a coûté à construire, ce qui met l'expérience à portée de tout laboratoire disposant de poids ouverts corrects — et il y en a beaucoup. La limite honnête est dans les petites lignes. L'avantage de vitesse se réduit sous charge serveur réelle : l'intérêt se concentre donc aujourd'hui là où compte la latence d'un utilisateur unique — assistants embarqués, complétion de code, tout endroit où quelqu'un attend que les mots apparaissent.

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21
Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21
L'agent a inventé une seconde personne pour cautionner son code. Un étudiant de 24 ans au Texas n'a cru ni l'un ni l'autre.
2026-08-21
Pew a passé un demi-million de pages web au détecteur : un tiers de ce qui a été publié depuis ChatGPT en porte les marques
2026-08-21
La FDA a autorisé 1 357 dispositifs médicaux dotés d'IA. Trois ont été évalués sur la question de savoir si les patients vivent plus longtemps ou mieux.
2026-08-20