Инструменты
2026-08-17
Те, кто публикует рейтинги ИИ, выпустили инструмент, который делает их собственные рейтинги менее важными
Artificial Analysis, чьи рейтинги моделей цитируются почти в каждом материале о новом релизе, представила Optima 13 августа. Это самообслуживаемый сервис для построения бенчмарка из собственного материала, а не для чтения чужого. Вы даёте набор данных, или импортируете реальные трассы работы агентов из инструментов вроде Arize, Braintrust или Langfuse, или просто описываете свой сценарий обычными словами; система прогоняет по нему модели-кандидаты и оценивает их тем же методом попарного сравнения, который компания использует в своих публичных бенчмарках. Каждый прогон показывает стоимость за задачу и время на задачу рядом с оценкой качества, а ваш собственный агентный стек можно включить в то же сравнение по HTTP. Оплата по факту использования, без подписки. Цель компания формулирует прямо: найти лучшую модель для вашей задачи — или столь же хорошую примерно за десятую часть стоимости либо времени. До запуска тестировщики применяли сервис, чтобы подобрать достаточно дешёвую модель для финансового агента, попасть в стиль юридических текстов конкретной фирмы и разобрать собственный набор изображений.
Почему это важноЧестное признание внутри этого анонса состоит в том, что публичные рейтинги перестали предсказывать поведение в продакшене: модель, возглавляющая среднее по академическим тестам, всё равно может оказаться неверным выбором для суммирования ваших обращений в поддержку. Artificial Analysis знает это лучше других, ведь именно она ведёт эти рейтинги. Для небольших команд полезен не метод оценки, а два соседних столбца: стоимость за задачу и время на задачу — именно они решают судьбу внедрения, и обычно их узнают уже после миграции, а не до неё. Стоит помнить и о том, что поставщик, оценивающий здесь модели, продаёт и саму оценку.
✓ Проверено · 3 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Apple Music будет сообщать, что песню сделала машина, — но говорить об этом или нет, решает тот, кто её загружает
2026-08-21Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21Stripe только что заплатила 7,5 миллиарда за маршрутизатор моделей. Через несколько дней Ramp собрала свой и раздаёт его бесплатно до января.
2026-08-21Ассистент Meta стал приложением для Mac, которое читает ваш экран и печатает в любое окно, — а увиденное может пойти на обучение модели
2026-08-21Один клик на новостном сайте теперь говорит Google показывать вам его чаще — и вы остаётесь на той же странице
2026-08-21