Herramientas
2026-08-04
Swiftlet mete un modelo de 80.000 millones de parámetros en 4,3 GB de RAM — y uno de 35B en un iPhone
Un nuevo runtime de código abierto en Swift y Metal llamado Swiftlet transmite bajo demanda los pesos de mezcla de expertos desde el disco: las capas de atención, los enrutadores y una caché de 'expertos' de uso frecuente permanecen en memoria mientras el resto se lee del almacenamiento. El resultado: Qwen3-Next-80B corre en un Mac M5 con unos 4,3 GB de RAM a 4,5-5 tokens por segundo, y un modelo de 35B funciona en un iPhone 17 a aproximadamente un token por segundo. Hay contrapartidas: el modelo grande exige 42 GB de disco libre, y el autor advierte de que estos modelos dispersos 'conversan como modelos grandes pero recuerdan hechos como modelos pequeños'. El proyecto llegó a lo más alto de Hacker News y superó las 280 estrellas en GitHub en un día.
Por qué importaEl muro de memoria — no el chip — era la razón por la que los modelos grandes no corrían en dispositivos de consumo. Si el streaming de expertos se sostiene, el hardware que ya posees accede a una clase de modelos que hasta ahora exigía una estación de trabajo con GPU, algo que importa para la privacidad, el uso sin conexión y quien no puede pagar llamadas de API.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Apple Music dirá cuándo una canción la hizo una máquina — pero quien la sube decide si lo declara
2026-08-21Stripe acaba de pagar 7.500 millones por un enrutador de modelos. Días después Ramp construyó uno y lo regala hasta enero.
2026-08-21El asistente de Meta es ya una app de Mac que lee tu pantalla y escribe en cualquier ventana — y lo que ve puede entrenar el modelo
2026-08-21Un clic en un medio le dice ahora a Google que te enseñe más de él — y tú no te mueves de la página que estabas leyendo
2026-08-21Adobe ya genera la música, la locución y el portazo — y dice que la licencia te cubre
2026-08-21