Investigación
2026-08-21
Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
Un banco de pruebas publicado en arXiv el 20 de agosto, AI4AI-Bench, examina algo más estrecho y más interesante que las evaluaciones habituales de programación: ¿puede un agente de IA mejorar los algoritmos que se usan para entrenar IA? El montaje consta de diez repositorios de investigación congelados que cubren diez familias de algoritmos de entrenamiento. El agente dispone de cuatro horas en una sola GPU B300 para modificar el código de entrenamiento; el resultado se ejecuta después hasta doce horas y se puntúa contra pruebas ocultas en una escala donde 0 es un modelo sin información, 0,1 es el algoritmo original sin modificar y 1,0 es el mejor resultado conocido. En 29 configuraciones de seis sistemas sobre las diez tareas, la puntuación media fue 0,166 y el mejor sistema individual alcanzó 0,250. La cifra más reveladora no habla de capacidad en absoluto. Los sistemas que sí intentaron modificar el algoritmo promediaron 0,226 frente a 0,126 de los que no lo intentaron, y al subir el esfuerzo de razonamiento la proporción de ejecuciones que intentaron un cambio pasó del 8 % al 64 %, elevando la media de 0,094 a 0,196. El artículo es una preimpresión y no ha sido revisado por pares.
Por qué importaLa automejora recursiva —IA que hace mejor a la IA, de forma acumulativa— es el mecanismo que sostiene la mayoría de los argumentos de despegue rápido, y se ha discutido casi siempre en abstracto. Este es uno de los primeros intentos serios de ponerle un número, y el número es pequeño: el mejor sistema recorrió una cuarta parte del camino hacia un resultado que ya existe en la literatura. Pero lo que conviene recordar es el modo de fallo. Los agentes no fallaban principalmente en la ciencia; la mayoría ni siquiera intentaba la ciencia y se replegaba a retoques seguros, y bastó con dejarles pensar más tiempo para multiplicar por ocho esa proporción. Es un límite de hábito, no de inteligencia, y los hábitos son justo el tipo de cosa que la ingeniería elimina deprisa.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21Rumor: el modelo anónimo que acaba de encabezar un test de programación, gratis, sería el buque insignia sin publicar de Zhipu
2026-08-21El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21Nvidia paga 6.000 millones de dólares por la máquina que fabrica los modelos de un rival — y contrata a 109 de quienes la manejaban
2026-08-21ChatGPT ya puede leer tus iMessages y enviarlos — y el ajuste que le permite dejar de preguntar es justo el que OpenAI advierte
2026-08-21