Recherche
2026-08-08
ARC Prize vérifie DeepSeek V4 Flash : 61 % à ARC-AGI-2 pour quatre centimes la tâche
L'équipe d'ARC Prize a publié les résultats semi-privés vérifiés du modèle à poids ouverts V4 Flash 0731 de DeepSeek : 89,0 % à ARC-AGI-1 pour environ deux centimes par tâche, et 61,4 % à ARC-AGI-2 pour environ quatre centimes, au niveau de raisonnement maximal. Le modèle est un mélange d'experts de 284 milliards de paramètres qui n'en active que 13 milliards par token et gère un contexte d'un million de tokens. Le résultat s'est hissé en tête de Hacker News, où le rapport prix-performance a concentré l'attention.
Pourquoi c'est importantARC-AGI-2 a été conçu pour résister à la mémorisation et récompenser le vrai raisonnement abstrait ; qu'un modèle ouvert à faible activation atteigne un tel score pour quelques centimes comble un fossé de plus entre IA ouverte et fermée. Pour les développeurs, le raisonnement quasi-frontière devient quelque chose qu'on télécharge et qu'on exécute — plus seulement qu'on loue.
✓ Vérifié · 2 sources
▶ Vidéo associée: DeepSeek V4 Flash GA IS INCREDIBLE! Powerful, Cheap, & Fast! (Fully Tested)
Lire dans l'app — gratuit, en 9 langues
Actus liées
L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21L'agent a inventé une seconde personne pour cautionner son code. Un étudiant de 24 ans au Texas n'a cru ni l'un ni l'autre.
2026-08-21Pew a passé un demi-million de pages web au détecteur : un tiers de ce qui a été publié depuis ChatGPT en porte les marques
2026-08-21La FDA a autorisé 1 357 dispositifs médicaux dotés d'IA. Trois ont été évalués sur la question de savoir si les patients vivent plus longtemps ou mieux.
2026-08-20