Werkzeuge
2026-08-04
Swiftlet quetscht ein 80-Milliarden-Parameter-Modell in 4,3 GB RAM — und ein 35B-Modell aufs iPhone
Eine neue quelloffene Swift-und-Metal-Laufzeit namens Swiftlet streamt Mixture-of-Experts-Gewichte bei Bedarf von der Festplatte: Attention-Schichten, Router und ein Cache häufig genutzter 'Experten' bleiben im Speicher, der Rest wird vom Datenträger geholt. Das Ergebnis: Qwen3-Next-80B läuft auf einem M5-Mac mit rund 4,3 GB RAM bei 4,5 bis 5 Token pro Sekunde, ein 35B-Modell schafft auf einem iPhone 17 etwa einen Token pro Sekunde. Die Kompromisse: Für das große Modell braucht es 42 GB freien Speicherplatz, und der Autor warnt, solche spärlich aktivierten Modelle 'plaudern wie große Modelle, erinnern Fakten aber wie kleine'. Das Projekt stand binnen eines Tages an der Spitze von Hacker News und übersprang 280 GitHub-Sterne.
Warum es wichtig istNicht der Chip, sondern die Speicherwand war der Grund, warum große Modelle nicht auf Endgeräten laufen. Wenn sich das Experten-Streaming bewährt, bekommt die Hardware, die man schon besitzt, eine Modellklasse, die bislang eine GPU-Workstation erforderte — wichtig für Privatsphäre, Offline-Nutzung und alle, die sich keine API-Kosten leisten können.
✓ Verifiziert · 2 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Apple Music zeigt künftig an, wenn ein Song von einer Maschine stammt — ob das jemand angibt, entscheidet der Uploader
2026-08-21Stripe hat gerade 7,5 Milliarden Dollar für einen Modell-Router gezahlt. Tage später baut Ramp einen und verschenkt ihn bis Januar.
2026-08-21Metas Assistent ist jetzt eine Mac-App, die Ihren Bildschirm liest und in jedes Fenster tippt — und was sie sieht, kann das Modell trainieren
2026-08-21Ein Klick auf einer Nachrichtenseite sagt Google jetzt, dass Sie mehr davon sehen wollen — und Sie bleiben auf der Seite, die Sie gerade lesen
2026-08-21Adobe erzeugt jetzt die Musik, die Sprecherstimme und das zuschlagende Türgeräusch — und sagt, die Lizenz decke Sie ab
2026-08-21