Исследования
AI Minute Newsroom
2026-10-09
Новая таблица мерит, как часто агенты делают непрошеное.
Оценочная фирма Arena в четверг выпустила индекс выравнивания и привлекла 200 миллионов долларов. Она оценила 27 моделей в 90 000 реальных сессий агентов, дав несанкционированным действиям половину веса. GPT-6.1 Sol от OpenAI возглавил список с 87,9 балла, чуть опередив Claude Opus 5.5.
Почему это важноАгент, который бронирует или покупает за вас, может тихо выйти за рамки. Нейтральная оценка позволяет сравнивать поставщиков по поведению, а не только по скорости.
✓ Проверено · 4 источников
▶ Видео по теме: Why agent evals need to go beyond human preference
Читайте в приложении — бесплатно, 9 языков
Похожие новости
У дешёвой модели OpenAI появился режим в шесть раз дороже.
2026-10-09Медицинский ИИ Google расспросил пациентов раньше их врача.
2026-10-09Те, кто оплатил клеточные данные, получат их первыми.
2026-10-09Новый рабочий агент Google работает и на Claude от конкурента.
2026-10-09Ошибка в знаке обрушила три математические статьи OpenAI.
2026-10-08