aiminute. ← Все новости ИИ
Исследования AI Minute Newsroom 2026-08-27

Сторонние исследователи впервые получили возможность изучить реальные логи переписки лаборатории. Больше половины разговоров оказались серьёзной работой.

Сторонние исследователи впервые получили возможность изучить реальные логи переписки лаборатории. Больше половины разговоров оказались серьёзной работой.

Anthropic опубликовала 26 августа результаты пилотного проекта, давшего трём внешним группам независимый доступ к реальному использованию Claude: Лаборатории социальных и языковых технологий Стэнфорда, Лаборатории обработки информации человеком в Оксфорде и METR, некоммерческой организации, оценивающей системы ИИ. Механизм — инструмент под названием Anthropic Insights, который возвращает агрегированную статистику, а не текст: сырые разговоры исследователи не видели ни разу. Каждая команда сама спроектировала своё исследование, а результаты прошли ту же юридическую проверку и проверку приватности, что и внутренние работы Anthropic, плюс дополнительный аудит всего, что уходило вовне. Каждая команда рассмотрела примерно 250 тысяч разговоров за апрель и май 2026 года. Стэнфорд обнаружил, что больше половины разговоров с Claude связаны с передачей задач, имеющих реальные последствия, причём заметное место занимают юридические и финансовые консультации, — это прямо противоречит прежнему предположению, что люди отдают малоответственную работу, а серьёзное оставляют себе. Почти в трёх четвертях разговоров человек руководил, а Claude помогал, а не получал задачу целиком. Оксфорд выяснил, что теплота модели шла рука об руку с более позитивным настроем пользователя, а модели вовлечённости напоминали обычный веб-сёрфинг больше, чем работу с инструментом. Предварительный анализ сессий Claude Code от METR показал, что новые модели дают существенное ускорение по сравнению со старыми, а собственные оценки времени от Claude неплохо коррелировали с реальными затратами разработчиков. Anthropic сообщает, что уже принимает заявки на следующий раунд.

Почему это важноПочти всё, что публика знает о реальном использовании этих систем, пришло от компаний, которые их продают, — в отчётах, написанных ими самими, о данных, которые видят только они. Это не заговор, а структурная проблема: проверить было нечем. Этот пилот её не решает, и о границах стоит говорить точно: участников выбрала Anthropic, инструмент построила Anthropic, проверку провела Anthropic, сводку опубликовала Anthropic. Это независимый анализ, но не независимый доступ. И всё же внешние учёные впервые опубликовали выводы на основе живых данных использования передовой лаборатории, и прецедент важнее любой отдельной цифры. Из самих цифр одна заслуживает внимания всех, кто пишет правила: если большинство разговоров связано с передачей задач, имеющих последствия, и заметная их доля — юридические и финансовые консультации, то мелкий дисклеймер внизу окна чата несёт куда больший вес, чем тот, на который он когда-либо был рассчитан.

✓ Проверено · 2 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

В мае OpenAI видела, как её модели выбираются из песочницы, и не остановила тест. В июле у них был root на боевом сервере Hugging Face.
2026-08-27
MIT построил модель, предсказывающую наводнение, которого никогда не было: 300 мм осадков на Нью-Йорк при рекорде около 200
2026-08-26
FDA одобрило 1357 медицинских устройств с ИИ. Три из них когда-либо проверяли на то, живут ли пациенты дольше или лучше.
2026-08-26
Лаборатория в Стэнфорде начала трёхмесячный запуск обучения на 535 миллиардов параметров публично — с кривыми потерь, составом данных и неудавшимися экспериментами
2026-08-25
Связанные с государствами хакерские группы более чем удвоили объём атак, как только отдали скучную часть модели
2026-08-25