AMD a publié Instella-MoE-16B-A3B, un modèle à mélange d'experts de 16 milliards de paramètres au total qui n'en active que 2,8 milliards par token, entraîné de bout en bout sur ses propres GPU Instinct MI300X et MI325X. Fait inhabituel : la publication inclut les checkpoints de chaque étape d'entraînement, les mélanges de données, les configurations et le code — le code sous licence MIT, les poids sous licence réservée à la recherche. AMD affirme que le modèle de base obtient la meilleure moyenne parmi les modèles entièrement ouverts, devant Moonlight-16B et OLMo-3.