aiminute. ← Todas las noticias de IA
Herramientas 2026-08-04

Cloudflare muestra cómo mete modelos abiertos de billones de parámetros en menos GPU

Cloudflare muestra cómo mete modelos abiertos de billones de parámetros en menos GPU

Cloudflare publicó el manual que usa para servir modelos abiertos de gran tamaño como Kimi K2.6 de Moonshot y GLM 5.2 de Z.ai en su plataforma Workers AI. Guardar la caché de atención en 8 bits en lugar de 16 duplica la capacidad de contexto hasta 1,37 millones de tokens y ofrece un 41 % más de rendimiento con un coste por token un 30 % menor; comprimir los pesos de GLM a 4 bits reduce el modelo de 705 GB a 421 GB. Según la compañía, la precisión en los bancos de pruebas fue indistinguible de la de los originales.

Por qué importaLa frontera de la economía de la IA no son solo modelos mejores: es servir los mismos modelos más barato. Técnicas como estas explican en buena parte por qué los grandes modelos abiertos cuestan cada vez menos de operar, y Cloudflare las publicó abiertamente para que cualquier equipo de infraestructura las copie.

✓ Verificado · 1 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Apple Music dirá cuándo una canción la hizo una máquina — pero quien la sube decide si lo declara
2026-08-21
Stripe acaba de pagar 7.500 millones por un enrutador de modelos. Días después Ramp construyó uno y lo regala hasta enero.
2026-08-21
El asistente de Meta es ya una app de Mac que lee tu pantalla y escribe en cualquier ventana — y lo que ve puede entrenar el modelo
2026-08-21
Un clic en un medio le dice ahora a Google que te enseñe más de él — y tú no te mueves de la página que estabas leyendo
2026-08-21
Adobe ya genera la música, la locución y el portazo — y dice que la licencia te cubre
2026-08-21