Investigación
AI Minute Newsroom
2026-08-22
El modelo por su cuenta sacó un 30 por ciento. Envuelto en el andamiaje de Nvidia, el mismo modelo lo resolvió todo.
Nvidia publicó el 21 de agosto los resultados de AVO, siglas de Agentic Variation Operators, un sistema de agente de programación de propósito general que completó los 183 niveles de los 25 entornos del conjunto público de ARC-AGI-3, el banco de pruebas de razonamiento interactivo, con una puntuación de 100,00 en la medida de eficiencia de acciones relativa al ser humano. Esos entornos no dan al agente instrucciones, ni reglas explícitas, ni un objetivo declarado: tiene que averiguar cuál es el juego jugándolo. El modelo de lenguaje que razonaba era Claude Opus 5 de Anthropic, que por sí solo y con alto esfuerzo de razonamiento llega a alrededor del 30 por ciento en el mismo conjunto. AVO necesitó 6.624 acciones, cerca de un 12 por ciento menos que VISTA, el mejor resultado anterior. Nvidia precisa que la prueba cubre solo el conjunto público de 25 entornos, no los conjuntos semiprivados ni privados de la competición.
Por qué importaDurante dos años se ha dado por supuesto que el progreso llega con el siguiente modelo. Este resultado dice que buena parte de él ya está disponible en el software que se envuelve alrededor de un modelo que cualquiera puede comprar: memoria, planificación, supervisión y un bucle que revisa su propio trabajo y vuelve a intentarlo. Los mismos pesos pasaron de un tercio del banco de pruebas a la totalidad sin reentrenarse. Eso cambia dónde debe ir el esfuerzo de ingeniería y convierte la pregunta sobre qué modelo usa un producto en un indicador mucho más débil de lo que ese producto puede hacer.
✓ Verificado · 3 fuentes
▶ Vídeo relacionado: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Un modelo aprendió sin el método que entrena a toda la IA.
2026-10-06TikTok metió un chatbot de compras dentro del vídeo que ves.
2026-10-06Reflection regalará un modelo de 501.000 millones de parámetros.
2026-10-06Wikimedia sospecha de agentes de OpenAI por la caída de mayo.
2026-10-06El asistente de Meta guarda una ficha horaria de tus conocidos.
2026-10-05