Investigación
AI Minute Newsroom
2026-08-23
Cuando un modelo pequeño pasa la conversación a uno grande, el grande vuelve a leerlo todo. Nvidia dice que una recta puede hacer la traducción.
Los sistemas que empiezan barato y escalan a un modelo más potente pagan un impuesto oculto: el modelo receptor relee la conversación entera desde cero, el paso llamado prefill, donde se concentra la mayor parte del coste de un prompt largo. En un artículo de arXiv (2608.03893) que ganó atención esta semana, investigadores de Nvidia informan de que la caché interna clave-valor de un modelo de una familia se proyecta sobre la de otro mediante una regresión lineal corriente, ajustada sin descenso de gradiente a partir de un conjunto de calibración de apenas 500 secuencias de 1.024 tokens y, al eliminar la codificación posicional, reutilizable con cualquier longitud de contexto. Transferir una caché de 32.768 tokens llevó 278 milisegundos frente a unos 7 segundos de relectura, y en seis pares de modelos de tres familias el mapeo resultó entre 2,7 y 25 veces más rápido. La parte honesta está en los resultados: conservó entre el 73 y el 98 por ciento de la precisión propia del modelo receptor en cuatro de los seis pares, y dos se degradaron con fuerza.
Por qué importaEl escalado —responder con algo pequeño y ceder el turno a algo grande cuando la pregunta se complica— es como se construyen de verdad casi todos los sistemas de agentes serios, y hoy ese relevo obliga a pagar dos veces por el mismo contexto. Si la traducción entre la memoria de trabajo de dos modelos es de veras casi lineal, ese segundo pago desaparece en gran medida. Que dos de seis pares fallen estrepitosamente es la razón para leer esto como resultado de investigación y no como una función: el método exige que ambos modelos compartan el mismo número de cabezas clave-valor y la misma dimensión por cabeza, es decir, la misma familia, y nadie ha demostrado que funcione entre fabricantes distintos.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
OpenAI sacó 722 artículos de matemáticas con una sola orden.
2026-10-07La web de problemas de Erdős dejó de aceptar demostraciones.
2026-10-07Repetir la misma tarea veinte veces bajó un tercio al mejor agente.
2026-10-06Un modelo aprendió sin el método que entrena a toda la IA.
2026-10-06Cinco problemas abiertos cayeron con un chat corriente.
2026-10-05