aiminute. ← Todas las noticias de IA
Herramientas AI Minute Newsroom 2026-08-23

Un modelo de 300 millones de parámetros adivina lo que dirá el grande, y un MacBook responde 2,87 veces más rápido

Un modelo de 300 millones de parámetros adivina lo que dirá el grande, y un MacBook responde 2,87 veces más rápido

Liquid AI publicó DSpark el 20 de agosto: modelos borrador pequeños, de unos 300 millones de parámetros cada uno, emparejados uno a uno con su familia LFM2.5 — el 1.2B Instruct, el 2.6B y el 8B-A1B. El borrador propone un bloque de nueve tokens por adelantado, el modelo real comprueba el bloque entero en un solo paso hacia adelante y descarta aquello con lo que no está de acuerdo. Con decodificación voraz, el texto que sale es idéntico al del modelo grande funcionando solo, así que la precisión en los benchmarks no se mueve. Lo que se mueve es el tiempo: hasta 3,18x en una H100, hasta 2,87x en un MacBook Pro con M4 Max, el modelo de 2.6B superando unos 140 tokens por segundo en ese portátil y un 57 por ciento menos de latencia de media en pruebas con múltiples herramientas. La trampa está en la tasa de aceptación. En MATH500 el borrador del 8B-A1B logra que se acepten 8,27 de cada 10 tokens propuestos, lo que vale 3,18x. En GSM8K logra 4,02, que vale 1,29x: mismo hardware, mismo modelo, alrededor de un tercio de la ganancia.

Por qué importaLa decodificación especulativa es esa rara optimización sin discusión de calidad adjunta: la salida es demostrablemente el mismo texto, así que lo único en juego es con qué frecuencia acierta el modelo pequeño. Por eso conviene entenderla antes de creerse cualquier cifra de aceleración que le vendan. Un proveedor que dice '3 veces más rápido' está citando su mejor carga de trabajo; la suya decide lo que realmente obtiene, y la distancia entre 3,18x y 1,29x es aquí toda la lección. Importa sobre todo a quien ejecuta modelos en su propia máquina en lugar de por API, porque este es el tipo de cambio que lleva a un modelo local de 'demasiado lento para molestarse' a 'lo bastante rápido para dejarlo abierto'.

✓ Verificado · 2 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Google te construye un juego jugable con una frase que escribas.
2026-10-08
ChatGPT deja que el modelo diseñe la pantalla, no solo la respuesta.
2026-10-08
Meta y Sierra proponen una sola norma de acceso para los agentes.
2026-10-07
Una IA diseñó un chip abierto que ejecuta modelos de lenguaje.
2026-10-07
El nuevo punto de acceso de OpenAI elige en 150 milisegundos.
2026-10-07