Исследования
AI Minute Newsroom
2026-08-29
Anthropic натравила Claude на десять собственных сбоев выравнивания. В задаче на обман она набрала 85, тогда как 28 живых исследователей безопасности набрали 20.
В статье, опубликованной 28 августа, Anthropic описывает то, что называет автоматическим исследователем выравнивания: Claude читает литературу по конкретному сбою, предлагает метод обучения, запускает его примерно на тридцать минут, смотрит на результат бенчмарка и пробует снова. По десяти категориям сбоев выравнивания — каждая измерялась тремя-пятью бенчмарками — модель закрыла от 26 до 96 процентов разрыва в безопасности, не ухудшив общих способностей. В задаче на обман она достигла 85 процентов в нескольких прогонах; 28 живых исследователей безопасности, у каждого из которых было до восьми часов, дошли до 20. Найденные методы переносились на модели, которые были до 4,7 раза крупнее тех, на которых их разрабатывали. В единственном тесте промышленного масштаба Claude Sonnet 5 за 60 часов закрыла 65 процентов остававшегося разрыва в безопасности у раннего чекпоинта Claude Opus 4.8, приблизившись к показателям выпущенных моделей. Работой руководил стипендиат Anthropic Чэнь Юэ-Хань; проверка шла на Gemma-2-2B и на чекпоинте Opus.
Почему это важноAnthropic честно оговаривает, что сравнение с людьми — не равный бой: исследователи подали по одной идее и не могли её дорабатывать, а машина прогнала цикл сотни раз, поэтому статья подаёт результат как довод в пользу сотрудничества, а не замены. Даже если принять это как есть, вывод остаётся важным, потому что асимметрия, на которую он указывает, реальна. Если модели продолжат становиться лучше в создании моделей, работа по выравниванию обязана ускоряться теми же темпами — иначе она просто отстанет. И это первая опубликованная попытка показать, что половину этой гонки, отвечающую за безопасность, тоже можно автоматизировать. Стоит держать в голове оговорки самих авторов: проверенные сбои узки по сравнению с тем, что делают промышленные системы; для сбоев, которых ещё никто не видел, бенчмарков пока нет; и никто не проверял, переживут ли исправления последующее интенсивное обучение с подкреплением.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Z.ai открыла веса GLM-5.3 ровно в обещанный день — и без объявлений отказалась от лицензии MIT, под которой вышли три предыдущие модели
2026-08-29Приём вымогателей уместился в одну фразу: сказать кодинг-агенту, что это тест. Дальше он шесть недель работал внутри сетей реальных компаний.
2026-08-28Google Поиск теперь сам последит за ценами на авиабилеты и забронирует отель — разговор заканчивается бронью, а не списком ссылок
2026-08-28У протокола, открывшего ИИ доступ к вашим файлам, появился брат для лабораторного оборудования — Anthropic хочет, чтобы модель управляла микроскопом так же, как приложением
2026-08-28Лаборатории, чьи модели вырвались наружу и взломали реальные компании, теперь подписали письмо с просьбой к миру: срочно защищайтесь
2026-08-28