aiminute. ← Alle KI-News
Werkzeuge AI Minute Newsroom 2026-08-04

Swiftlet quetscht ein 80-Milliarden-Parameter-Modell in 4,3 GB RAM — und ein 35B-Modell aufs iPhone

Swiftlet quetscht ein 80-Milliarden-Parameter-Modell in 4,3 GB RAM — und ein 35B-Modell aufs iPhone

Eine neue quelloffene Swift-und-Metal-Laufzeit namens Swiftlet streamt Mixture-of-Experts-Gewichte bei Bedarf von der Festplatte: Attention-Schichten, Router und ein Cache häufig genutzter 'Experten' bleiben im Speicher, der Rest wird vom Datenträger geholt. Das Ergebnis: Qwen3-Next-80B läuft auf einem M5-Mac mit rund 4,3 GB RAM bei 4,5 bis 5 Token pro Sekunde, ein 35B-Modell schafft auf einem iPhone 17 etwa einen Token pro Sekunde. Die Kompromisse: Für das große Modell braucht es 42 GB freien Speicherplatz, und der Autor warnt, solche spärlich aktivierten Modelle 'plaudern wie große Modelle, erinnern Fakten aber wie kleine'. Das Projekt stand binnen eines Tages an der Spitze von Hacker News und übersprang 280 GitHub-Sterne.

Warum es wichtig istNicht der Chip, sondern die Speicherwand war der Grund, warum große Modelle nicht auf Endgeräten laufen. Wenn sich das Experten-Streaming bewährt, bekommt die Hardware, die man schon besitzt, eine Modellklasse, die bislang eine GPU-Workstation erforderte — wichtig für Privatsphäre, Offline-Nutzung und alle, die sich keine API-Kosten leisten können.

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06
Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05
Ein Befehl holt den von Apple gelöschten KI-Schalter zurück.
2026-10-05
OpenAI verspricht täglich eine Neuerung oder setzt Limits zurück.
2026-10-05
Meta gab die Firmware frei, damit Sie ein Muse-Gerät bauen.
2026-10-04