Herramientas
AI Minute Newsroom
2026-08-04
Swiftlet mete un modelo de 80.000 millones de parámetros en 4,3 GB de RAM — y uno de 35B en un iPhone
Un nuevo runtime de código abierto en Swift y Metal llamado Swiftlet transmite bajo demanda los pesos de mezcla de expertos desde el disco: las capas de atención, los enrutadores y una caché de 'expertos' de uso frecuente permanecen en memoria mientras el resto se lee del almacenamiento. El resultado: Qwen3-Next-80B corre en un Mac M5 con unos 4,3 GB de RAM a 4,5-5 tokens por segundo, y un modelo de 35B funciona en un iPhone 17 a aproximadamente un token por segundo. Hay contrapartidas: el modelo grande exige 42 GB de disco libre, y el autor advierte de que estos modelos dispersos 'conversan como modelos grandes pero recuerdan hechos como modelos pequeños'. El proyecto llegó a lo más alto de Hacker News y superó las 280 estrellas en GitHub en un día.
Por qué importaEl muro de memoria — no el chip — era la razón por la que los modelos grandes no corrían en dispositivos de consumo. Si el streaming de expertos se sostiene, el hardware que ya posees accede a una clase de modelos que hasta ahora exigía una estación de trabajo con GPU, algo que importa para la privacidad, el uso sin conexión y quien no puede pagar llamadas de API.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
TikTok metió un chatbot de compras dentro del vídeo que ves.
2026-10-06El asistente de Meta guarda una ficha horaria de tus conocidos.
2026-10-05Un comando devuelve el interruptor de IA que Apple borró.
2026-10-05OpenAI promete una mejora diaria en Codex o reiniciar tus límites.
2026-10-05Meta liberó el firmware para que construyas tu propio aparato Muse.
2026-10-04