Outils
AI Minute Newsroom
2026-08-23
Un modèle de 300 millions de paramètres devine ce que le grand va dire — et un MacBook répond 2,87 fois plus vite
Liquid AI a publié DSpark le 20 août : de petits modèles brouillons d'environ 300 millions de paramètres chacun, appariés un à un avec sa famille LFM2.5 — le 1.2B Instruct, le 2.6B et le 8B-A1B. Le brouillon propose un bloc de neuf jetons d'avance, le vrai modèle vérifie tout le bloc en une seule passe avant, et rejette ce avec quoi il n'est pas d'accord. En décodage glouton, le texte produit est identique à celui du grand modèle seul : la précision aux benchmarks ne bouge donc pas. Ce qui bouge, c'est le temps : jusqu'à 3,18x sur une H100, jusqu'à 2,87x sur un MacBook Pro M4 Max, le modèle 2.6B dépassant environ 140 jetons par seconde sur ce portable, et 57 pour cent de latence en moins en moyenne sur des tests multi-outils. Le piège tient au taux d'acceptation. Sur MATH500, le brouillon du 8B-A1B fait accepter 8,27 jetons proposés sur 10, ce qui vaut 3,18x. Sur GSM8K, il en fait accepter 4,02, ce qui vaut 1,29x — même matériel, même modèle, environ un tiers du gain.
Pourquoi c'est importantLe décodage spéculatif est cette rare optimisation sans débat de qualité attaché : la sortie est prouvablement le même texte, la seule question restante étant la fréquence à laquelle le petit modèle devine juste. D'où l'intérêt de la comprendre avant de croire un chiffre d'accélération qu'on vous vend. Un fournisseur qui annonce « 3 fois plus rapide » cite sa meilleure charge de travail ; la vôtre décide de ce que vous obtenez réellement, et l'écart entre 3,18x et 1,29x résume ici toute la leçon. Cela compte surtout pour qui fait tourner des modèles sur sa propre machine plutôt que via une API, car c'est le genre de changement qui fait passer un modèle local de « trop lent pour s'y mettre » à « assez rapide pour le laisser ouvert ».
✓ Vérifié · 2 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Google vous fabrique un jeu jouable à partir d'une phrase.
2026-10-08ChatGPT laisse le modèle dessiner l'écran, pas que la réponse.
2026-10-08Meta et Sierra proposent une seule règle d'accès pour les agents.
2026-10-07Une IA a conçu une puce ouverte qui fait tourner des modèles.
2026-10-07Le nouveau point d'accès d'OpenAI choisit en 150 millisecondes.
2026-10-07