aiminute. ← Todas las noticias de IA
Herramientas AI Minute Newsroom 2026-08-04

Cloudflare muestra cómo mete modelos abiertos de billones de parámetros en menos GPU

Cloudflare muestra cómo mete modelos abiertos de billones de parámetros en menos GPU

Cloudflare publicó el manual que usa para servir modelos abiertos de gran tamaño como Kimi K2.6 de Moonshot y GLM 5.2 de Z.ai en su plataforma Workers AI. Guardar la caché de atención en 8 bits en lugar de 16 duplica la capacidad de contexto hasta 1,37 millones de tokens y ofrece un 41 % más de rendimiento con un coste por token un 30 % menor; comprimir los pesos de GLM a 4 bits reduce el modelo de 705 GB a 421 GB. Según la compañía, la precisión en los bancos de pruebas fue indistinguible de la de los originales.

Por qué importaLa frontera de la economía de la IA no son solo modelos mejores: es servir los mismos modelos más barato. Técnicas como estas explican en buena parte por qué los grandes modelos abiertos cuestan cada vez menos de operar, y Cloudflare las publicó abiertamente para que cualquier equipo de infraestructura las copie.

✓ Verificado · 1 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

TikTok metió un chatbot de compras dentro del vídeo que ves.
2026-10-06
El asistente de Meta guarda una ficha horaria de tus conocidos.
2026-10-05
Un comando devuelve el interruptor de IA que Apple borró.
2026-10-05
OpenAI promete una mejora diaria en Codex o reiniciar tus límites.
2026-10-05
Meta liberó el firmware para que construyas tu propio aparato Muse.
2026-10-04