Anthropic a publié le 26 août les résultats d'un projet pilote ayant donné à trois équipes extérieures un accès indépendant à l'usage réel de Claude : le Social and Language Technologies Lab de Stanford, le Human Information Processing Lab d'Oxford et METR, l'association à but non lucratif qui évalue les systèmes d'IA. Le dispositif s'appuie sur un outil nommé Anthropic Insights, qui renvoie des statistiques agrégées et non du texte : les chercheurs n'ont jamais vu de conversations brutes. Chaque équipe a conçu sa propre étude, et les résultats sont passés par la même revue juridique et de confidentialité que les travaux internes d'Anthropic, plus un audit supplémentaire de tout ce qui a été partagé à l'extérieur. Chacune a examiné environ 250 000 conversations d'avril et mai 2026. Stanford a constaté que plus de la moitié des conversations avec Claude consistaient à déléguer des tâches à conséquences, le conseil juridique et financier occupant une place notable — ce qui contredit frontalement l'hypothèse antérieure selon laquelle on délègue le travail peu engageant et garde les choses sérieuses pour soi. Dans près des trois quarts des conversations, l'humain dirigeait et Claude assistait, plutôt qu'une remise complète de la tâche. Oxford a observé que la chaleur du modèle allait de pair avec un ressenti plus positif chez l'utilisateur, et que les schémas d'engagement ressemblaient davantage à de la navigation web ordinaire qu'à l'usage d'un outil. L'analyse préliminaire de METR sur des sessions Claude Code montre que les modèles récents apportent une accélération significative par rapport aux anciens, et que les estimations de durée faites par Claude corrélaient assez bien avec le temps réellement passé par les développeurs. Anthropic indique recueillir désormais les manifestations d'intérêt pour la prochaine série.