aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-08-25

Un laboratoire de Stanford a lancé en public un entraînement de trois mois à 535 milliards de paramètres — courbes de perte, mélange de données et expériences ratées compris

Un laboratoire de Stanford a lancé en public un entraînement de trois mois à 535 milliards de paramètres — courbes de perte, mélange de données et expériences ratées compris

Le projet Marin de Percy Liang a commencé le préentraînement de Marin 535B-A23B, un modèle à mélange d'experts de 535 milliards de paramètres dont 23 milliards actifs par token, sur 11 baies GB200 NVL72. Le plan publié : 18 750 milliards de tokens — 80 % de préentraînement, 20 % d'entraînement intermédiaire — sur environ trois mois et près de 2,7e24 FLOPs, suivis d'un post-entraînement. Ce qui le distingue d'une sortie ordinaire, c'est que l'exécution elle-même est ouverte : courbes de perte en direct, mélange de données, télémétrie matérielle, configurations, artefacts d'ingénierie et expériences qui n'ont pas marché, avec la possibilité pour l'extérieur de proposer et de lancer des expériences via GitHub. Avant de démarrer, l'équipe a entraîné une échelle de modèles plus petits pour figer la recette.

Pourquoi c'est importantPresque tout ce que le public sait de l'entraînement d'un grand modèle vient de poids finis et d'un article écrit après coup. Les arbitrages, les impasses et les heures où une exécution se déstabilise sont précisément ce que les laboratoires ne publient pas, et c'est là que réside l'essentiel du métier. Une exécution à 2,7e24 FLOPs menée à ciel ouvert offre pour la première fois à des gens extérieurs à un laboratoire de frontière la possibilité de voir ces décisions au moment où elles se prennent — à une échelle assez proche de la frontière pour que les enseignements se transposent.

✓ Vérifié · 3 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Les équipes de piratage liées à des États ont plus que doublé leur volume d'attaques dès qu'elles ont confié les tâches ingrates à un modèle
2026-08-25
Une question à laquelle les mathématiciens n'avaient pas su répondre depuis 1948 a reçu dimanche sa réponse, dans un fichier de 108 pages publié sur X
2026-08-25
À la fin de l'an dernier, neuf articles biomédicaux sur dix portaient les empreintes d'un modèle de langage
2026-08-24
Près de 90 pour cent des dirigeants disent que l'IA n'a pas augmenté la productivité. Les coupes ont lieu quand même.
2026-08-24
Un ancien Claude a enfreint la propre règle de contenu d'Anthropic 10 fois sur 10 — et il est toujours vendu via Azure et Bedrock
2026-08-23