Investigación
AI Minute Newsroom
2026-08-23
Cuando un modelo pequeño pasa la conversación a uno grande, el grande vuelve a leerlo todo. Nvidia dice que una recta puede hacer la traducción.
Los sistemas que empiezan barato y escalan a un modelo más potente pagan un impuesto oculto: el modelo receptor relee la conversación entera desde cero, el paso llamado prefill, donde se concentra la mayor parte del coste de un prompt largo. En un artículo de arXiv (2608.03893) que ganó atención esta semana, investigadores de Nvidia informan de que la caché interna clave-valor de un modelo de una familia se proyecta sobre la de otro mediante una regresión lineal corriente, ajustada sin descenso de gradiente a partir de un conjunto de calibración de apenas 500 secuencias de 1.024 tokens y, al eliminar la codificación posicional, reutilizable con cualquier longitud de contexto. Transferir una caché de 32.768 tokens llevó 278 milisegundos frente a unos 7 segundos de relectura, y en seis pares de modelos de tres familias el mapeo resultó entre 2,7 y 25 veces más rápido. La parte honesta está en los resultados: conservó entre el 73 y el 98 por ciento de la precisión propia del modelo receptor en cuatro de los seis pares, y dos se degradaron con fuerza.
Por qué importaEl escalado —responder con algo pequeño y ceder el turno a algo grande cuando la pregunta se complica— es como se construyen de verdad casi todos los sistemas de agentes serios, y hoy ese relevo obliga a pagar dos veces por el mismo contexto. Si la traducción entre la memoria de trabajo de dos modelos es de veras casi lineal, ese segundo pago desaparece en gran medida. Que dos de seis pares fallen estrepitosamente es la razón para leer esto como resultado de investigación y no como una función: el método exige que ambos modelos compartan el mismo número de cabezas clave-valor y la misma dimensión por cabeza, es decir, la misma familia, y nadie ha demostrado que funcione entre fabricantes distintos.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Un modelo de 27.000 millones de parámetros superó a Opus 4.8 y a GPT-5.5 reproduciendo artículos publicados
2026-08-23Dale a un modelo la bibliografía de un artículo sin publicar y pregúntale qué dice. Los mejores aciertan el 15 por ciento de las veces.
2026-08-22Tres cuartas partes de los estadounidenses no quieren un centro de datos cerca. Hace un año estaban divididos por igual.
2026-08-22El modelo por su cuenta sacó un 30 por ciento. Envuelto en el andamiaje de Nvidia, el mismo modelo lo resolvió todo.
2026-08-22El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21