Herramientas
AI Minute Newsroom
2026-08-23
Un modelo de 300 millones de parámetros adivina lo que dirá el grande, y un MacBook responde 2,87 veces más rápido
Liquid AI publicó DSpark el 20 de agosto: modelos borrador pequeños, de unos 300 millones de parámetros cada uno, emparejados uno a uno con su familia LFM2.5 — el 1.2B Instruct, el 2.6B y el 8B-A1B. El borrador propone un bloque de nueve tokens por adelantado, el modelo real comprueba el bloque entero en un solo paso hacia adelante y descarta aquello con lo que no está de acuerdo. Con decodificación voraz, el texto que sale es idéntico al del modelo grande funcionando solo, así que la precisión en los benchmarks no se mueve. Lo que se mueve es el tiempo: hasta 3,18x en una H100, hasta 2,87x en un MacBook Pro con M4 Max, el modelo de 2.6B superando unos 140 tokens por segundo en ese portátil y un 57 por ciento menos de latencia de media en pruebas con múltiples herramientas. La trampa está en la tasa de aceptación. En MATH500 el borrador del 8B-A1B logra que se acepten 8,27 de cada 10 tokens propuestos, lo que vale 3,18x. En GSM8K logra 4,02, que vale 1,29x: mismo hardware, mismo modelo, alrededor de un tercio de la ganancia.
Por qué importaLa decodificación especulativa es esa rara optimización sin discusión de calidad adjunta: la salida es demostrablemente el mismo texto, así que lo único en juego es con qué frecuencia acierta el modelo pequeño. Por eso conviene entenderla antes de creerse cualquier cifra de aceleración que le vendan. Un proveedor que dice '3 veces más rápido' está citando su mejor carga de trabajo; la suya decide lo que realmente obtiene, y la distancia entre 3,18x y 1,29x es aquí toda la lección. Importa sobre todo a quien ejecuta modelos en su propia máquina en lugar de por API, porque este es el tipo de cambio que lleva a un modelo local de 'demasiado lento para molestarse' a 'lo bastante rápido para dejarlo abierto'.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Un índice de búsqueda hecho para agentes que programan, no para personas: 70 millones de READMEs, incidencias y pull requests, y sin clave para probarlo
2026-08-23El estándar que enchufa la IA a tus herramientas se diseñó pensando en una persona pulsando 'permitir'. Su nueva hoja de ruta admite que quien llama ya es una máquina.
2026-08-23OpenAI ha regalado el motor que hay debajo de Codex, y sus propios números dicen que el motor vale más que el modelo
2026-08-22Un modelo de voz que empieza a hablar en menos de 50 milisegundos, y el código de servicio es abierto
2026-08-22Anthropic dejará que su modelo más potente cace fallos en tu código, pero no te dejará hablar con él
2026-08-22