aiminute. ← Toute l’actu IA
Nouveaux Modèles 2026-08-14

Le modèle le plus rapide d'OpenAI n'est pas un modèle plus petit : c'est le même, tournant sur les puces d'un concurrent

Le modèle le plus rapide d'OpenAI n'est pas un modèle plus petit : c'est le même, tournant sur les puces d'un concurrent

OpenAI a ouvert le 13 août une préversion limitée du mode Ultrafast : GPT-5.6 Sol servi jusqu'à 750 tokens de sortie par seconde dans l'API, ce que l'entreprise chiffre à jusqu'à 14 fois sa vitesse standard. Cette vitesse ne vient pas d'un modèle distillé ou allégé mais du matériel de Cerebras, de sorte que la sortie doit être exactement le Sol que les clients utilisent déjà. L'accès est réservé à un petit groupe de clients API le temps d'étendre la capacité, et OpenAI n'a pas publié de tarifs. L'entreprise cite comme usages la réponse aux incidents, le support client, l'analyse financière et le commerce en ligne, des charges de travail où le facteur limitant est la latence et non la capacité brute.

Pourquoi c'est importantJusqu'ici, obtenir une réponse rapide revenait à en accepter une moins bonne : modèle plus petit, contexte plus court, réglage spécialisé. Dissocier la vitesse de la capacité change la liste des produits réalisables : un agent qui doit passer vingt appels d'outils avant de dire quoi que ce soit est inutilisable à vitesse standard et parfaitement banal à 750 tokens par seconde. L'annonce contient aussi un aveu plus discret. Le service de frontière le plus rapide d'OpenAI tourne sur le silicium d'un concurrent, pas sur celui de Nvidia ni sur l'infrastructure que l'entreprise construit à coups de centaines de milliards de dollars.

✓ Vérifié · 3 sources

▶ Vidéo associée: Why OpenAI Chose Cerebras Over NVIDIA for GPT-5.6 Sol
WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21
Montrez-le au robot une fois — de trois à douze secondes — et il réussit 59 fois sur 100 sans le moindre entraînement
2026-08-21
Le modèle invente ses propres exercices, construit le banc d'essai qui les évalue, puis s'entraîne sur le résultat — et DeepReinforce a donné les poids
2026-08-20
Un modèle gratuit qui tient sur une seule carte graphique obtient 52 — puis dépense 22 276 jetons de réflexion pour dessiner une image
2026-08-18
Zhipu n'a pas construit un nouveau modèle. Elle a continué d'entraîner l'ancien — et affirme que le code s'est amélioré de 50 %
2026-08-17