aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-08-23

Quand un petit modèle passe la conversation à un grand, le grand relit tout. Nvidia affirme qu'une droite peut faire la traduction.

Quand un petit modèle passe la conversation à un grand, le grand relit tout. Nvidia affirme qu'une droite peut faire la traduction.

Les systèmes qui démarrent avec un modèle bon marché puis escaladent vers un plus puissant paient une taxe cachée : le modèle receveur relit toute la conversation depuis le début, l'étape dite de préremplissage, où se concentre l'essentiel du coût d'une longue requête. Dans un article publié sur arXiv (2608.03893) et remarqué cette semaine, des chercheurs de Nvidia rapportent que le cache interne clé-valeur d'un modèle d'une même famille se projette sur celui d'un autre par une simple régression linéaire, ajustée sans descente de gradient à partir d'un jeu de calibration de seulement 500 séquences de 1 024 jetons et, l'encodage positionnel une fois retiré, réutilisable à n'importe quelle longueur de contexte. Le transfert d'un cache de 32 768 jetons a pris 278 millisecondes, contre environ 7 secondes pour une relecture ; sur six paires de modèles issues de trois familles, l'application était 2,7 à 25 fois plus rapide. La part honnête est dans les résultats : elle a conservé 73 à 98 % de la précision propre du modèle receveur sur quatre des six paires, et deux se sont fortement dégradées.

Pourquoi c'est importantL'escalade — répondre avec un petit modèle, passer la main à un grand quand la question durcit — est la façon dont sont réellement bâtis la plupart des systèmes d'agents sérieux, et ce relais impose aujourd'hui de payer deux fois le même contexte. Si la traduction entre les mémoires de travail de deux modèles est vraiment quasi linéaire, ce second paiement disparaît en grande partie. Que deux paires sur six échouent lourdement est la raison de lire ceci comme un résultat de recherche et non comme une fonctionnalité : la méthode exige que les deux modèles partagent le même nombre de têtes clé-valeur et la même dimension par tête, donc la même famille, et personne n'a montré qu'elle fonctionne d'un fabricant à l'autre.

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Un modèle de 27 milliards de paramètres a battu Opus 4.8 et GPT-5.5 pour reproduire des articles publiés
2026-08-23
Donnez à un modèle la bibliographie d'un article non publié et demandez-lui ce que dit l'article. Les meilleurs trouvent 15 pour cent du temps.
2026-08-22
Trois quarts des Américains ne veulent pas de centre de données près de chez eux. Il y a un an, ils étaient partagés à égalité.
2026-08-22
Le modèle seul obtenait 30 pour cent. Enveloppé dans l'échafaudage de Nvidia, le même modèle a tout franchi.
2026-08-22
L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21