aiminute. ← Toute l’actu IA
Outils AI Minute Newsroom 2026-08-23

Un modèle de 300 millions de paramètres devine ce que le grand va dire — et un MacBook répond 2,87 fois plus vite

Un modèle de 300 millions de paramètres devine ce que le grand va dire — et un MacBook répond 2,87 fois plus vite

Liquid AI a publié DSpark le 20 août : de petits modèles brouillons d'environ 300 millions de paramètres chacun, appariés un à un avec sa famille LFM2.5 — le 1.2B Instruct, le 2.6B et le 8B-A1B. Le brouillon propose un bloc de neuf jetons d'avance, le vrai modèle vérifie tout le bloc en une seule passe avant, et rejette ce avec quoi il n'est pas d'accord. En décodage glouton, le texte produit est identique à celui du grand modèle seul : la précision aux benchmarks ne bouge donc pas. Ce qui bouge, c'est le temps : jusqu'à 3,18x sur une H100, jusqu'à 2,87x sur un MacBook Pro M4 Max, le modèle 2.6B dépassant environ 140 jetons par seconde sur ce portable, et 57 pour cent de latence en moins en moyenne sur des tests multi-outils. Le piège tient au taux d'acceptation. Sur MATH500, le brouillon du 8B-A1B fait accepter 8,27 jetons proposés sur 10, ce qui vaut 3,18x. Sur GSM8K, il en fait accepter 4,02, ce qui vaut 1,29x — même matériel, même modèle, environ un tiers du gain.

Pourquoi c'est importantLe décodage spéculatif est cette rare optimisation sans débat de qualité attaché : la sortie est prouvablement le même texte, la seule question restante étant la fréquence à laquelle le petit modèle devine juste. D'où l'intérêt de la comprendre avant de croire un chiffre d'accélération qu'on vous vend. Un fournisseur qui annonce « 3 fois plus rapide » cite sa meilleure charge de travail ; la vôtre décide de ce que vous obtenez réellement, et l'écart entre 3,18x et 1,29x résume ici toute la leçon. Cela compte surtout pour qui fait tourner des modèles sur sa propre machine plutôt que via une API, car c'est le genre de changement qui fait passer un modèle local de « trop lent pour s'y mettre » à « assez rapide pour le laisser ouvert ».

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Un index de recherche conçu pour les agents qui codent, pas pour les humains : 70 millions de README, tickets et pull requests, et aucune clé pour l'essayer
2026-08-23
La norme qui branche l'IA sur vos outils a été conçue pour un humain cliquant sur « autoriser ». Sa nouvelle feuille de route reconnaît que l'appelant est désormais une machine.
2026-08-23
OpenAI a donné le moteur qui tourne sous Codex, et ses propres chiffres disent que le moteur vaut plus que le modèle
2026-08-22
Un modèle vocal qui commence à parler en moins de 50 millisecondes, et le code de service est ouvert
2026-08-22
Anthropic laisse son modèle le plus puissant traquer les failles de votre code, mais vous interdit de lui parler
2026-08-22