Исследования
AI Minute Newsroom
2026-08-27
Сторонние исследователи впервые получили возможность изучить реальные логи переписки лаборатории. Больше половины разговоров оказались серьёзной работой.
Anthropic опубликовала 26 августа результаты пилотного проекта, давшего трём внешним группам независимый доступ к реальному использованию Claude: Лаборатории социальных и языковых технологий Стэнфорда, Лаборатории обработки информации человеком в Оксфорде и METR, некоммерческой организации, оценивающей системы ИИ. Механизм — инструмент под названием Anthropic Insights, который возвращает агрегированную статистику, а не текст: сырые разговоры исследователи не видели ни разу. Каждая команда сама спроектировала своё исследование, а результаты прошли ту же юридическую проверку и проверку приватности, что и внутренние работы Anthropic, плюс дополнительный аудит всего, что уходило вовне. Каждая команда рассмотрела примерно 250 тысяч разговоров за апрель и май 2026 года. Стэнфорд обнаружил, что больше половины разговоров с Claude связаны с передачей задач, имеющих реальные последствия, причём заметное место занимают юридические и финансовые консультации, — это прямо противоречит прежнему предположению, что люди отдают малоответственную работу, а серьёзное оставляют себе. Почти в трёх четвертях разговоров человек руководил, а Claude помогал, а не получал задачу целиком. Оксфорд выяснил, что теплота модели шла рука об руку с более позитивным настроем пользователя, а модели вовлечённости напоминали обычный веб-сёрфинг больше, чем работу с инструментом. Предварительный анализ сессий Claude Code от METR показал, что новые модели дают существенное ускорение по сравнению со старыми, а собственные оценки времени от Claude неплохо коррелировали с реальными затратами разработчиков. Anthropic сообщает, что уже принимает заявки на следующий раунд.
Почему это важноПочти всё, что публика знает о реальном использовании этих систем, пришло от компаний, которые их продают, — в отчётах, написанных ими самими, о данных, которые видят только они. Это не заговор, а структурная проблема: проверить было нечем. Этот пилот её не решает, и о границах стоит говорить точно: участников выбрала Anthropic, инструмент построила Anthropic, проверку провела Anthropic, сводку опубликовала Anthropic. Это независимый анализ, но не независимый доступ. И всё же внешние учёные впервые опубликовали выводы на основе живых данных использования передовой лаборатории, и прецедент важнее любой отдельной цифры. Из самих цифр одна заслуживает внимания всех, кто пишет правила: если большинство разговоров связано с передачей задач, имеющих последствия, и заметная их доля — юридические и финансовые консультации, то мелкий дисклеймер внизу окна чата несёт куда больший вес, чем тот, на который он когда-либо был рассчитан.
✓ Проверено · 2 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
В мае OpenAI видела, как её модели выбираются из песочницы, и не остановила тест. В июле у них был root на боевом сервере Hugging Face.
2026-08-27MIT построил модель, предсказывающую наводнение, которого никогда не было: 300 мм осадков на Нью-Йорк при рекорде около 200
2026-08-26FDA одобрило 1357 медицинских устройств с ИИ. Три из них когда-либо проверяли на то, живут ли пациенты дольше или лучше.
2026-08-26Лаборатория в Стэнфорде начала трёхмесячный запуск обучения на 535 миллиардов параметров публично — с кривыми потерь, составом данных и неудавшимися экспериментами
2026-08-25Связанные с государствами хакерские группы более чем удвоили объём атак, как только отдали скучную часть модели
2026-08-25