AMD lanzó Instella-MoE-16B-A3B, un modelo de mezcla de expertos con 16.000 millones de parámetros totales que activa solo 2.800 millones por token, entrenado de principio a fin en sus propias GPU Instinct MI300X y MI325X. Lo inusual: la publicación incluye los checkpoints de cada etapa de entrenamiento, las mezclas de datos, las configuraciones y el código — el código bajo licencia MIT y los pesos bajo licencia solo de investigación. AMD afirma que el modelo base logra el mejor promedio entre los modelos totalmente abiertos, por delante de Moonlight-16B y OLMo-3.