aiminute. ← Todas las noticias de IA
Investigación AI Minute Newsroom 2026-08-25

Un laboratorio de Stanford ha empezado en público un entrenamiento de tres meses y 535.000 millones de parámetros: curvas de pérdida, mezcla de datos y experimentos fallidos incluidos

Un laboratorio de Stanford ha empezado en público un entrenamiento de tres meses y 535.000 millones de parámetros: curvas de pérdida, mezcla de datos y experimentos fallidos incluidos

El proyecto Marin, de Percy Liang, ha iniciado el preentrenamiento de Marin 535B-A23B, un modelo de mezcla de expertos con 535.000 millones de parámetros y 23.000 millones activos por token, sobre 11 racks GB200 NVL72. El plan publicado son 18,75 billones de tokens —80 por ciento de preentrenamiento y 20 por ciento de entrenamiento intermedio— durante unos tres meses y cerca de 2,7e24 FLOPs, con postentrenamiento después. Lo que lo distingue de un lanzamiento normal es que la propia ejecución está abierta: curvas de pérdida en vivo, la mezcla de datos, telemetría del hardware, configuraciones, artefactos de ingeniería y los experimentos que no funcionaron, con gente de fuera capaz de proponer y ejecutar pruebas por GitHub. Antes de arrancar, el equipo entrenó una escalera de modelos pequeños para fijar la receta.

Por qué importaCasi todo lo que el público sabe sobre entrenar un modelo grande procede de pesos terminados y de un artículo escrito después. Las decisiones de criterio, los callejones sin salida y las horas en que una ejecución se desestabiliza son justo lo que los laboratorios no publican, y son la mayor parte del oficio real. Una ejecución de 2,7e24 FLOPs sucediendo a la vista es la primera oportunidad de que gente ajena a un laboratorio de frontera vea esas decisiones mientras se toman, a una escala lo bastante cercana a la frontera como para que lo aprendido siga sirviendo.

✓ Verificado · 3 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Los grupos de intrusión vinculados a Estados más que duplicaron su volumen de ataques al pasarle a un modelo la parte aburrida
2026-08-25
Una pregunta que los matemáticos no habían podido responder desde 1948 se respondió el domingo, en un archivo de 108 páginas subido a X
2026-08-25
A finales del año pasado, nueve de cada diez artículos biomédicos llevaban las huellas de un modelo de lenguaje
2026-08-24
Cerca del 90 por ciento de los directivos dice que la IA no ha elevado la productividad. Los recortes se hacen igual.
2026-08-24
Un Claude antiguo incumplió la propia norma de contenido de Anthropic en 10 de 10 intentos, y sigue a la venta en Azure y Bedrock
2026-08-23