Nouveaux Modèles
2026-08-21
Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
DeepSeek a mis en ligne le 21 août sur sa plateforme d'API un modèle multimodal expérimental, DeepSeek-V4-Flash-Vision-Exp. C'est le V4 Flash, jusque-là uniquement textuel, augmenté de la compréhension d'images : l'entreprise affirme qu'il égale le modèle de base sur le texte — agents, raisonnement, connaissance du monde — tout en réalisant ce qu'elle qualifie de bond majeur sur les tests d'agents multimodaux, le rapprochant d'Opus 4.8 d'Anthropic. Les limites documentées sont inhabituellement généreuses : une fenêtre de contexte de 1 048 576 tokens, jusqu'à 384 000 tokens en sortie, jusqu'à 600 images dans une seule requête et un plafond de facturation de 384 tokens par image. Il accepte les formats d'API compatibles OpenAI et Anthropic. OpenRouter, qui le décrit comme un modèle à mélange épars d'experts avec environ 13 milliards de paramètres actifs sur 284 milliards, le facture 0,22 dollar par million de tokens en entrée et 0,66 par million en sortie. Bloomberg a présenté la sortie comme la réponse de DeepSeek à l'avance d'Anthropic. La comparaison avec Opus 4.8 est une affirmation de DeepSeek et n'a pas encore été reproduite de façon indépendante.
Pourquoi c'est importantCe qui compte ici n'est pas qu'il « puisse regarder des images » — tout modèle sérieux regarde des images. Ce qui compte, c'est qu'il puisse regarder une capture d'écran puis en faire quelque chose, ce qu'un agent pilotant un ordinateur doit précisément savoir faire, et DeepSeek dit y être proche de la pointe tout en facturant quelques centimes par million de tokens. Si des tests indépendants le confirment, le coût de construction d'agents lisant l'écran s'effondre pour tous ceux qui ne sont pas de grandes entreprises — et cela tombe la même semaine où Meta et OpenAI ont lancé des assistants de bureau qui regardent votre écran. Les réserves sont dans le nom et le prix : « exp » signifie expérimental, les résultats de référence viennent du fournisseur lui-même, et un modèle conçu pour lire 600 images par requête est aussi un modèle capable de lire 600 de vos captures d'écran.
✓ Vérifié · 4 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21ChatGPT peut désormais lire vos iMessages et les envoyer — et le réglage qui lui évite de demander est celui-là même dont OpenAI met en garde
2026-08-21Montrez-le au robot une fois — de trois à douze secondes — et il réussit 59 fois sur 100 sans le moindre entraînement
2026-08-21L'agent a inventé une seconde personne pour cautionner son code. Un étudiant de 24 ans au Texas n'a cru ni l'un ni l'autre.
2026-08-21Slack a donné aux agents de code leurs propres canaux : le travail devient quelque chose que toute l'équipe regarde se faire
2026-08-20