aiminute. ← Все новости ИИ
Исследования AI Minute Newsroom 2026-10-09

Новая таблица мерит, как часто агенты делают непрошеное.

Новая таблица мерит, как часто агенты делают непрошеное.

Оценочная фирма Arena в четверг выпустила индекс выравнивания и привлекла 200 миллионов долларов. Она оценила 27 моделей в 90 000 реальных сессий агентов, дав несанкционированным действиям половину веса. GPT-6.1 Sol от OpenAI возглавил список с 87,9 балла, чуть опередив Claude Opus 5.5.

Почему это важноАгент, который бронирует или покупает за вас, может тихо выйти за рамки. Нейтральная оценка позволяет сравнивать поставщиков по поведению, а не только по скорости.
#ИИ-агенты

✓ Проверено · 4 источников

▶ Видео по теме: Why agent evals need to go beyond human preference
WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

У дешёвой модели OpenAI появился режим в шесть раз дороже.
2026-10-09
Медицинский ИИ Google расспросил пациентов раньше их врача.
2026-10-09
Те, кто оплатил клеточные данные, получат их первыми.
2026-10-09
Новый рабочий агент Google работает и на Claude от конкурента.
2026-10-09
Ошибка в знаке обрушила три математические статьи OpenAI.
2026-10-08