Investigación
2026-08-22
El modelo por su cuenta sacó un 30 por ciento. Envuelto en el andamiaje de Nvidia, el mismo modelo lo resolvió todo.
Nvidia publicó el 21 de agosto los resultados de AVO, siglas de Agentic Variation Operators, un sistema de agente de programación de propósito general que completó los 183 niveles de los 25 entornos del conjunto público de ARC-AGI-3, el banco de pruebas de razonamiento interactivo, con una puntuación de 100,00 en la medida de eficiencia de acciones relativa al ser humano. Esos entornos no dan al agente instrucciones, ni reglas explícitas, ni un objetivo declarado: tiene que averiguar cuál es el juego jugándolo. El modelo de lenguaje que razonaba era Claude Opus 5 de Anthropic, que por sí solo y con alto esfuerzo de razonamiento llega a alrededor del 30 por ciento en el mismo conjunto. AVO necesitó 6.624 acciones, cerca de un 12 por ciento menos que VISTA, el mejor resultado anterior. Nvidia precisa que la prueba cubre solo el conjunto público de 25 entornos, no los conjuntos semiprivados ni privados de la competición.
Por qué importaDurante dos años se ha dado por supuesto que el progreso llega con el siguiente modelo. Este resultado dice que buena parte de él ya está disponible en el software que se envuelve alrededor de un modelo que cualquiera puede comprar: memoria, planificación, supervisión y un bucle que revisa su propio trabajo y vuelve a intentarlo. Los mismos pesos pasaron de un tercio del banco de pruebas a la totalidad sin reentrenarse. Eso cambia dónde debe ir el esfuerzo de ingeniería y convierte la pregunta sobre qué modelo usa un producto en un indicador mucho más débil de lo que ese producto puede hacer.
✓ Verificado · 3 fuentes
▶ Vídeo relacionado: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Tres cuartas partes de los estadounidenses no quieren un centro de datos cerca. Hace un año estaban divididos por igual.
2026-08-22Anthropic dejará que su modelo más potente cace fallos en tu código, pero no te dejará hablar con él
2026-08-22El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21Rumor: el modelo anónimo que acaba de encabezar un test de programación, gratis, sería el buque insignia sin publicar de Zhipu
2026-08-21El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21