Nouveaux Modèles
2026-08-12
45 millions de paramètres, 14 mégaoctets, et il appelle quand même des outils : le modèle qui tourne sur un microcontrôleur
Cactus a publié Needle 2 le 10 août : un modèle de langage de 45 millions de paramètres conçu pour le travail d'agent — appel d'outils, pilotage d'un appareil, extraction de données structurées depuis un texte — livré sous forme d'un binaire de 14 Mo et exécutant une session complète dans environ 28 Mo de RAM. L'astuce tient à une quantification appliquée dès le début de l'entraînement plutôt qu'ajoutée ensuite. Cactus entraîne poids, activations et cache KV en 2 bits de bout en bout : le modèle déployé est donc exactement celui qui a été entraîné, ce qui évite l'effondrement de qualité que provoque à cette taille une compression 2 bits a posteriori. Il décode à plus de 500 jetons par seconde sur un Raspberry Pi 5, avec un préremplissage au-delà de 800 ; il tourne à 400–1 500 sur casques de réalité virtuelle et 300–700 sur des téléphones Android à moins de 200 dollars, et fonctionne sur microcontrôleurs ESP32-S3, Meta Quest 3S et Apple Vision Pro. Sur cinq bancs d'essai publics d'appel d'outils, il fait jeu égal avec des modèles 5 à 70 fois plus gros tournant en pleine précision : 63,7 % sur Mobile Actions, contre 69,1 % pour le LFM2.5 230M de Liquid AI et 64,0 % pour FunctionGemma 270M. Les poids sont sous licence Apache 2.0 sur Hugging Face et GitHub.
Pourquoi c'est importantPresque tous les assistants vocaux logés aujourd'hui dans une sonnette, une voiture ou des écouteurs sont des clients légers branchés sur le centre de données d'un autre : d'où le fait qu'ils cessent de marcher sans réseau, qu'ils coûtent de l'argent au fabricant à chaque interaction, et que ce que vous dites transite par un serveur. Un modèle de cette taille change ce calcul, car 14 Mo tiennent dans la mémoire flash d'un composant à quelques dollars. Needle 2 n'est pas brillant et ne tient pas une conversation ; il est fait pour comprendre une consigne et appuyer sur le bon bouton, ce qui correspond à l'essentiel des besoins réels de ces appareils. La licence Apache 2.0 permet à quiconque de l'embarquer, et la conséquence intéressante n'est pas des gadgets plus malins, mais des gadgets qui continuent de fonctionner — et de se taire — quand internet a disparu.
✓ Vérifié · 3 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21ChatGPT peut désormais lire vos iMessages et les envoyer — et le réglage qui lui évite de demander est celui-là même dont OpenAI met en garde
2026-08-21Montrez-le au robot une fois — de trois à douze secondes — et il réussit 59 fois sur 100 sans le moindre entraînement
2026-08-21L'agent a inventé une seconde personne pour cautionner son code. Un étudiant de 24 ans au Texas n'a cru ni l'un ni l'autre.
2026-08-21