Investigación
AI Minute Newsroom
2026-08-21
Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
Un banco de pruebas publicado en arXiv el 20 de agosto, AI4AI-Bench, examina algo más estrecho y más interesante que las evaluaciones habituales de programación: ¿puede un agente de IA mejorar los algoritmos que se usan para entrenar IA? El montaje consta de diez repositorios de investigación congelados que cubren diez familias de algoritmos de entrenamiento. El agente dispone de cuatro horas en una sola GPU B300 para modificar el código de entrenamiento; el resultado se ejecuta después hasta doce horas y se puntúa contra pruebas ocultas en una escala donde 0 es un modelo sin información, 0,1 es el algoritmo original sin modificar y 1,0 es el mejor resultado conocido. En 29 configuraciones de seis sistemas sobre las diez tareas, la puntuación media fue 0,166 y el mejor sistema individual alcanzó 0,250. La cifra más reveladora no habla de capacidad en absoluto. Los sistemas que sí intentaron modificar el algoritmo promediaron 0,226 frente a 0,126 de los que no lo intentaron, y al subir el esfuerzo de razonamiento la proporción de ejecuciones que intentaron un cambio pasó del 8 % al 64 %, elevando la media de 0,094 a 0,196. El artículo es una preimpresión y no ha sido revisado por pares.
Por qué importaLa automejora recursiva —IA que hace mejor a la IA, de forma acumulativa— es el mecanismo que sostiene la mayoría de los argumentos de despegue rápido, y se ha discutido casi siempre en abstracto. Este es uno de los primeros intentos serios de ponerle un número, y el número es pequeño: el mejor sistema recorrió una cuarta parte del camino hacia un resultado que ya existe en la literatura. Pero lo que conviene recordar es el modo de fallo. Los agentes no fallaban principalmente en la ciencia; la mayoría ni siquiera intentaba la ciencia y se replegaba a retoques seguros, y bastó con dejarles pensar más tiempo para multiplicar por ocho esa proporción. Es un límite de hábito, no de inteligencia, y los hábitos son justo el tipo de cosa que la ingeniería elimina deprisa.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El asistente de Meta guarda una ficha horaria de tus conocidos.
2026-10-05Dos senadores piden cárcel para jefes cuyos agentes de IA hackean.
2026-10-05OpenAI promete una mejora diaria en Codex o reiniciar tus límites.
2026-10-05Cinco problemas abiertos cayeron con un chat corriente.
2026-10-05El modelo sin ajustar resolvió tareas que su versión pulida no logró.
2026-10-04