aiminute. ← Все новости ИИ
Исследования AI Minute Newsroom 2026-08-29

Исследователи отдали 70 фрагментов собственной лабораторной работы в качестве экзамена. Лучший ИИ-агент довёл до конца 30 процентов

Исследователи отдали 70 фрагментов собственной лабораторной работы в качестве экзамена. Лучший ИИ-агент довёл до конца 30 процентов

Terminal-Bench-Science 0.1, выпущенный на этой неделе исследователями Стэнфорда вместе с командами Terminal-Bench и Harbor, — это бенчмарк, собранный из работы, которую учёные делают на самом деле. Каждое из 70 заданий передал исследователь, взявший вычислительный рабочий процесс из собственной лаборатории и превративший его в задачу, которую агент может попробовать решить в терминале, — по наукам о жизни, физическим, наукам о Земле, математическим и инженерным. Каждое задание выполняется в контейнере и проверяется программно: оценка показывает, получилась ли работа, а не заявил ли агент, что она получилась. Результаты низкие намеренно: Claude Opus 5 лидирует с долей решённых 30,0 процента, GPT-5.6 Sol набирает 22,4 процента, Claude Fable 5 — 21,4 процента. Все модели показали более чем на десять пунктов худший результат, чем на общем Terminal-Bench 3.0. В проекте перечислены 376 участников из 22 стран; сейчас собираются задания для версии 0.2, срок подачи — 5 октября.

Почему это важноУтверждение, что ИИ вот-вот ускорит науку, обычно подкрепляют экзаменационными тестами — вопросами с известным ответом, какие учёному перестали задавать много лет назад. Здесь измеряется другое: способна ли система запустить конвейер, справиться с форматами файлов, заметить сбой на шаге и выдать результат, который исследователь примет. Тридцать процентов — это реальная цифра, которую есть куда улучшать, а не насыщенный показатель; и поскольку задания пришли от названных поимённо участников из конкретных областей, провалы куда-то указывают: видно, в каких науках агенты слабее всего, а не только то, что они слабы.
#ИИ-агенты#Наука и исследования

✓ Проверено · 4 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Модель по умолчанию в Slack теперь Claude, а работа продавцов Salesforce упакована в 37 навыков, которые запускаются прямо из чат-окна
2026-08-29
Anthropic натравила Claude на десять собственных сбоев выравнивания. В задаче на обман она набрала 85, тогда как 28 живых исследователей безопасности набрали 20.
2026-08-29
Z.ai открыла веса GLM-5.3 ровно в обещанный день — и без объявлений отказалась от лицензии MIT, под которой вышли три предыдущие модели
2026-08-29
Приём вымогателей уместился в одну фразу: сказать кодинг-агенту, что это тест. Дальше он шесть недель работал внутри сетей реальных компаний.
2026-08-28
Google Поиск теперь сам последит за ценами на авиабилеты и забронирует отель — разговор заканчивается бронью, а не списком ссылок
2026-08-28