aiminute. ← Все новости ИИ
Исследования 2026-08-22

Сама по себе модель набрала 30 процентов. В обёртке Nvidia та же модель прошла всё.

Сама по себе модель набрала 30 процентов. В обёртке Nvidia та же модель прошла всё.

21 августа Nvidia опубликовала результаты AVO, то есть Agentic Variation Operators: эта универсальная система кодирующего агента прошла все 183 уровня во всех 25 средах открытого набора ARC-AGI-3, эталона интерактивного рассуждения, набрав 100,00 по показателю эффективности действий относительно человека. Эти среды не дают агенту ни инструкций, ни явных правил, ни заявленной цели: он должен понять, что это за игра, играя в неё. Думала языковая модель Claude Opus 5 от Anthropic, которая сама по себе и при высоком усилии рассуждения даёт на том же наборе около 30 процентов. AVO потребовалось 6 624 действия в средах, примерно на 12 процентов меньше, чем VISTA, прежнему лучшему результату. Nvidia отмечает, что прогон охватывает только открытый набор из 25 сред, а не полузакрытые или закрытые соревновательные наборы.

Почему это важноДва года рабочим допущением было то, что прогресс приходит со следующей моделью. Этот результат говорит, что значительная его часть теперь берётся из программного слоя, обёрнутого вокруг модели, которую уже можно купить: память, планирование, надзор и цикл, который проверяет собственную работу и пробует снова. Одни и те же веса без переобучения прошли путь от трети эталона до всего целиком. Это меняет то, куда должны идти инженерные усилия, и превращает вопрос о том, на какой модели работает продукт, в куда более слабый признак того, на что этот продукт способен.
#Программирование#ИИ-агенты

✓ Проверено · 3 источников

▶ Видео по теме: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Три четверти американцев не хотят дата-центр рядом с домом. Год назад мнения делились поровну.
2026-08-22
Anthropic пустит самую сильную свою модель искать дыры в вашем коде, но говорить с ней не даст
2026-08-22
Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21
Слух: анонимная модель, бесплатно возглавившая тест по программированию, якобы является невыпущенным флагманом Zhipu
2026-08-21
Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21