aiminute. ← Todas las noticias de IA
Investigación 2026-08-22

El modelo por su cuenta sacó un 30 por ciento. Envuelto en el andamiaje de Nvidia, el mismo modelo lo resolvió todo.

El modelo por su cuenta sacó un 30 por ciento. Envuelto en el andamiaje de Nvidia, el mismo modelo lo resolvió todo.

Nvidia publicó el 21 de agosto los resultados de AVO, siglas de Agentic Variation Operators, un sistema de agente de programación de propósito general que completó los 183 niveles de los 25 entornos del conjunto público de ARC-AGI-3, el banco de pruebas de razonamiento interactivo, con una puntuación de 100,00 en la medida de eficiencia de acciones relativa al ser humano. Esos entornos no dan al agente instrucciones, ni reglas explícitas, ni un objetivo declarado: tiene que averiguar cuál es el juego jugándolo. El modelo de lenguaje que razonaba era Claude Opus 5 de Anthropic, que por sí solo y con alto esfuerzo de razonamiento llega a alrededor del 30 por ciento en el mismo conjunto. AVO necesitó 6.624 acciones, cerca de un 12 por ciento menos que VISTA, el mejor resultado anterior. Nvidia precisa que la prueba cubre solo el conjunto público de 25 entornos, no los conjuntos semiprivados ni privados de la competición.

Por qué importaDurante dos años se ha dado por supuesto que el progreso llega con el siguiente modelo. Este resultado dice que buena parte de él ya está disponible en el software que se envuelve alrededor de un modelo que cualquiera puede comprar: memoria, planificación, supervisión y un bucle que revisa su propio trabajo y vuelve a intentarlo. Los mismos pesos pasaron de un tercio del banco de pruebas a la totalidad sin reentrenarse. Eso cambia dónde debe ir el esfuerzo de ingeniería y convierte la pregunta sobre qué modelo usa un producto en un indicador mucho más débil de lo que ese producto puede hacer.
#Programación#Agentes IA

✓ Verificado · 3 fuentes

▶ Vídeo relacionado: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

Tres cuartas partes de los estadounidenses no quieren un centro de datos cerca. Hace un año estaban divididos por igual.
2026-08-22
Anthropic dejará que su modelo más potente cace fallos en tu código, pero no te dejará hablar con él
2026-08-22
El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21
Rumor: el modelo anónimo que acaba de encabezar un test de programación, gratis, sería el buque insignia sin publicar de Zhipu
2026-08-21
El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21