Recherche
AI Minute Newsroom
2026-08-25
Un laboratoire de Stanford a lancé en public un entraînement de trois mois à 535 milliards de paramètres — courbes de perte, mélange de données et expériences ratées compris
Le projet Marin de Percy Liang a commencé le préentraînement de Marin 535B-A23B, un modèle à mélange d'experts de 535 milliards de paramètres dont 23 milliards actifs par token, sur 11 baies GB200 NVL72. Le plan publié : 18 750 milliards de tokens — 80 % de préentraînement, 20 % d'entraînement intermédiaire — sur environ trois mois et près de 2,7e24 FLOPs, suivis d'un post-entraînement. Ce qui le distingue d'une sortie ordinaire, c'est que l'exécution elle-même est ouverte : courbes de perte en direct, mélange de données, télémétrie matérielle, configurations, artefacts d'ingénierie et expériences qui n'ont pas marché, avec la possibilité pour l'extérieur de proposer et de lancer des expériences via GitHub. Avant de démarrer, l'équipe a entraîné une échelle de modèles plus petits pour figer la recette.
Pourquoi c'est importantPresque tout ce que le public sait de l'entraînement d'un grand modèle vient de poids finis et d'un article écrit après coup. Les arbitrages, les impasses et les heures où une exécution se déstabilise sont précisément ce que les laboratoires ne publient pas, et c'est là que réside l'essentiel du métier. Une exécution à 2,7e24 FLOPs menée à ciel ouvert offre pour la première fois à des gens extérieurs à un laboratoire de frontière la possibilité de voir ces décisions au moment où elles se prennent — à une échelle assez proche de la frontière pour que les enseignements se transposent.
✓ Vérifié · 3 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Les équipes de piratage liées à des États ont plus que doublé leur volume d'attaques dès qu'elles ont confié les tâches ingrates à un modèle
2026-08-25Une question à laquelle les mathématiciens n'avaient pas su répondre depuis 1948 a reçu dimanche sa réponse, dans un fichier de 108 pages publié sur X
2026-08-25À la fin de l'an dernier, neuf articles biomédicaux sur dix portaient les empreintes d'un modèle de langage
2026-08-24Près de 90 pour cent des dirigeants disent que l'IA n'a pas augmenté la productivité. Les coupes ont lieu quand même.
2026-08-24Un ancien Claude a enfreint la propre règle de contenu d'Anthropic 10 fois sur 10 — et il est toujours vendu via Azure et Bedrock
2026-08-23