Исследования
2026-08-07
'Одобрить'? 40 000 игровых сессий: люди пропускают каждую третью опасную команду ИИ-агента
Компания Scale X превратила запросы разрешений ИИ-агентов в браузерную игру и проанализировала более 40 000 сессий с 409 000 решений 'одобрить/отклонить'. Средняя точность — 66,3%: игроки одобряли примерно каждую третью вредоносную команду, а треть сессий закончилась с отрицательным счётом. Бдительность падала по мере накопления одобрений; самая пропускаемая угроза — скрипт 'npm run analyze', способный исполнить произвольный код, — одобрялась почти в 65% случаев.
Почему это важно'Каждую команду одобряет человек' — стандартный ответ отрасли на вопрос о безопасности агентов. Это крупнейший открытый набор данных, показывающий, как сильно эта защита протекает от усталости — ровно тот сценарий отказа, который регуляторы и лаборатории считают решённым. Настоящая защита, похоже, требует песочниц и лучшего дизайна разрешений, а не большего числа кликов.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21Слух: анонимная модель, бесплатно возглавившая тест по программированию, якобы является невыпущенным флагманом Zhipu
2026-08-21Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21Nvidia платит 6 миллиардов долларов за машину, которая строит модели конкурента, — и нанимает 109 человек, которые ею управляли
2026-08-21Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
2026-08-21