aiminute. ← Все новости ИИ
Исследования 2026-08-21

Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали

Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали

Опубликованный на arXiv 20 августа бенчмарк AI4AI-Bench проверяет вопрос более узкий и более интересный, чем обычные оценки программирования: может ли ИИ-агент улучшить алгоритмы, которыми обучают ИИ? Конструкция включает десять замороженных исследовательских репозиториев, охватывающих десять семейств алгоритмов обучения. Агенту даётся четыре часа на одном GPU B300, чтобы изменить обучающий код; результат затем запускается на срок до двенадцати часов и оценивается по скрытым бенчмаркам по шкале, где 0 — неинформативная модель, 0,1 — исходный неизменённый алгоритм, а 1,0 — лучший известный результат. По 29 конфигурациям шести систем на всех десяти задачах средний балл составил 0,166, лучшая отдельная система достигла 0,250. Самая показательная цифра вообще не о способностях. Системы, которые действительно пытались изменить алгоритм, набрали в среднем 0,226 против 0,126 у тех, кто не пытался, — а при повышении усилий на рассуждение доля запусков с попыткой изменения выросла с 8 до 64 процентов, а средний балл — с 0,094 до 0,196. Статья представляет собой препринт и не прошла рецензирование.

Почему это важноРекурсивное самоулучшение — ИИ, который делает ИИ лучше, с накоплением эффекта, — это механизм, лежащий в основе большинства аргументов о быстром взлёте, и до сих пор он обсуждался в основном отвлечённо. Это одна из первых серьёзных попыток поставить рядом с ним число, и число небольшое: лучшая система прошла четверть пути к результату, который уже есть в литературе. Но запомнить стоит характер провала. Агенты в основном не проваливались в науке; большинство из них науку даже не пробовало, скатываясь к безопасной возне, — и достаточно было дать им думать дольше, чтобы эта доля изменилась в восемь раз. Это предел привычки, а не интеллекта, а привычки как раз относятся к тому, что инженерия устраняет быстро.
#Программирование#ИИ-агенты

✓ Проверено · 2 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21
Слух: анонимная модель, бесплатно возглавившая тест по программированию, якобы является невыпущенным флагманом Zhipu
2026-08-21
Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21
Nvidia платит 6 миллиардов долларов за машину, которая строит модели конкурента, — и нанимает 109 человек, которые ею управляли
2026-08-21
ChatGPT теперь может читать ваши iMessage и отправлять их — а настройка, позволяющая ему не спрашивать, и есть та, о которой предупреждает сама OpenAI
2026-08-21