Werkzeuge
AI Minute Newsroom
2026-08-04
Swiftlet quetscht ein 80-Milliarden-Parameter-Modell in 4,3 GB RAM — und ein 35B-Modell aufs iPhone
Eine neue quelloffene Swift-und-Metal-Laufzeit namens Swiftlet streamt Mixture-of-Experts-Gewichte bei Bedarf von der Festplatte: Attention-Schichten, Router und ein Cache häufig genutzter 'Experten' bleiben im Speicher, der Rest wird vom Datenträger geholt. Das Ergebnis: Qwen3-Next-80B läuft auf einem M5-Mac mit rund 4,3 GB RAM bei 4,5 bis 5 Token pro Sekunde, ein 35B-Modell schafft auf einem iPhone 17 etwa einen Token pro Sekunde. Die Kompromisse: Für das große Modell braucht es 42 GB freien Speicherplatz, und der Autor warnt, solche spärlich aktivierten Modelle 'plaudern wie große Modelle, erinnern Fakten aber wie kleine'. Das Projekt stand binnen eines Tages an der Spitze von Hacker News und übersprang 280 GitHub-Sterne.
Warum es wichtig istNicht der Chip, sondern die Speicherwand war der Grund, warum große Modelle nicht auf Endgeräten laufen. Wenn sich das Experten-Streaming bewährt, bekommt die Hardware, die man schon besitzt, eine Modellklasse, die bislang eine GPU-Workstation erforderte — wichtig für Privatsphäre, Offline-Nutzung und alle, die sich keine API-Kosten leisten können.
✓ Verifiziert · 2 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05Ein Befehl holt den von Apple gelöschten KI-Schalter zurück.
2026-10-05OpenAI verspricht täglich eine Neuerung oder setzt Limits zurück.
2026-10-05Meta gab die Firmware frei, damit Sie ein Muse-Gerät bauen.
2026-10-04