Исследования
AI Minute Newsroom
2026-08-22
Сама по себе модель набрала 30 процентов. В обёртке Nvidia та же модель прошла всё.
21 августа Nvidia опубликовала результаты AVO, то есть Agentic Variation Operators: эта универсальная система кодирующего агента прошла все 183 уровня во всех 25 средах открытого набора ARC-AGI-3, эталона интерактивного рассуждения, набрав 100,00 по показателю эффективности действий относительно человека. Эти среды не дают агенту ни инструкций, ни явных правил, ни заявленной цели: он должен понять, что это за игра, играя в неё. Думала языковая модель Claude Opus 5 от Anthropic, которая сама по себе и при высоком усилии рассуждения даёт на том же наборе около 30 процентов. AVO потребовалось 6 624 действия в средах, примерно на 12 процентов меньше, чем VISTA, прежнему лучшему результату. Nvidia отмечает, что прогон охватывает только открытый набор из 25 сред, а не полузакрытые или закрытые соревновательные наборы.
Почему это важноДва года рабочим допущением было то, что прогресс приходит со следующей моделью. Этот результат говорит, что значительная его часть теперь берётся из программного слоя, обёрнутого вокруг модели, которую уже можно купить: память, планирование, надзор и цикл, который проверяет собственную работу и пробует снова. Одни и те же веса без переобучения прошли путь от трети эталона до всего целиком. Это меняет то, куда должны идти инженерные усилия, и превращает вопрос о том, на какой модели работает продукт, в куда более слабый признак того, на что этот продукт способен.
✓ Проверено · 3 источников
▶ Видео по теме: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Модель обучилась без метода, которым обучают весь ИИ.
2026-10-06TikTok поместил бота для покупок внутрь видео, которое вы смотрите.
2026-10-06Reflection бесплатно отдаст модель на 501 миллиард параметров.
2026-10-06Wikimedia подозревает агентов OpenAI в майском сбое.
2026-10-06Помощник Meta ведёт почасовое дело на всех ваших знакомых.
2026-10-05