aiminute. ← Toute l’actu IA
Outils AI Minute Newsroom 2026-08-04

Swiftlet fait tenir un modèle de 80 milliards de paramètres dans 4,3 Go de RAM — et un 35B sur un iPhone

Swiftlet fait tenir un modèle de 80 milliards de paramètres dans 4,3 Go de RAM — et un 35B sur un iPhone

Un nouveau runtime open source en Swift et Metal, Swiftlet, streame à la demande les poids d'un mélange d'experts depuis le disque : les couches d'attention, les routeurs et un cache des 'experts' les plus sollicités restent en mémoire, le reste est lu depuis le stockage. Résultat : Qwen3-Next-80B tourne sur un Mac M5 avec environ 4,3 Go de RAM à 4,5-5 tokens par seconde, et un modèle de 35 milliards fonctionne sur un iPhone 17 à environ un token par seconde. Les compromis demeurent : il faut 42 Go de disque libre pour le grand modèle, et l'auteur prévient que ces modèles creux 'conversent comme de grands modèles mais retiennent les faits comme de petits'. Le projet a dominé Hacker News et dépassé 280 étoiles GitHub en une journée.

Pourquoi c'est importantC'est le mur de la mémoire — pas la puce — qui empêchait les grands modèles de tourner sur le matériel grand public. Si le streaming d'experts tient ses promesses, votre matériel actuel accède à une classe de modèles qui exigeait jusqu'ici une station de travail GPU : un enjeu pour la vie privée, l'usage hors ligne et tous ceux qui ne peuvent pas payer d'API.

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

TikTok a glissé un chatbot d'achat dans la vidéo que vous regardez.
2026-10-06
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05
Une commande rend l'interrupteur d'IA qu'Apple avait supprimé.
2026-10-05
OpenAI promet une amélioration par jour sinon il remet vos quotas.
2026-10-05
Meta a ouvert le firmware pour fabriquer votre propre appareil Muse.
2026-10-04