Исследования
2026-08-21
Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
Опубликованный на arXiv 20 августа бенчмарк AI4AI-Bench проверяет вопрос более узкий и более интересный, чем обычные оценки программирования: может ли ИИ-агент улучшить алгоритмы, которыми обучают ИИ? Конструкция включает десять замороженных исследовательских репозиториев, охватывающих десять семейств алгоритмов обучения. Агенту даётся четыре часа на одном GPU B300, чтобы изменить обучающий код; результат затем запускается на срок до двенадцати часов и оценивается по скрытым бенчмаркам по шкале, где 0 — неинформативная модель, 0,1 — исходный неизменённый алгоритм, а 1,0 — лучший известный результат. По 29 конфигурациям шести систем на всех десяти задачах средний балл составил 0,166, лучшая отдельная система достигла 0,250. Самая показательная цифра вообще не о способностях. Системы, которые действительно пытались изменить алгоритм, набрали в среднем 0,226 против 0,126 у тех, кто не пытался, — а при повышении усилий на рассуждение доля запусков с попыткой изменения выросла с 8 до 64 процентов, а средний балл — с 0,094 до 0,196. Статья представляет собой препринт и не прошла рецензирование.
Почему это важноРекурсивное самоулучшение — ИИ, который делает ИИ лучше, с накоплением эффекта, — это механизм, лежащий в основе большинства аргументов о быстром взлёте, и до сих пор он обсуждался в основном отвлечённо. Это одна из первых серьёзных попыток поставить рядом с ним число, и число небольшое: лучшая система прошла четверть пути к результату, который уже есть в литературе. Но запомнить стоит характер провала. Агенты в основном не проваливались в науке; большинство из них науку даже не пробовало, скатываясь к безопасной возне, — и достаточно было дать им думать дольше, чтобы эта доля изменилась в восемь раз. Это предел привычки, а не интеллекта, а привычки как раз относятся к тому, что инженерия устраняет быстро.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21Слух: анонимная модель, бесплатно возглавившая тест по программированию, якобы является невыпущенным флагманом Zhipu
2026-08-21Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21Nvidia платит 6 миллиардов долларов за машину, которая строит модели конкурента, — и нанимает 109 человек, которые ею управляли
2026-08-21ChatGPT теперь может читать ваши iMessage и отправлять их — а настройка, позволяющая ему не спрашивать, и есть та, о которой предупреждает сама OpenAI
2026-08-21