aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-08-27

Des chercheurs extérieurs ont pu étudier pour la première fois les journaux de conversation réels d'un laboratoire. Plus de la moitié portaient sur du travail à conséquences.

Des chercheurs extérieurs ont pu étudier pour la première fois les journaux de conversation réels d'un laboratoire. Plus de la moitié portaient sur du travail à conséquences.

Anthropic a publié le 26 août les résultats d'un projet pilote ayant donné à trois équipes extérieures un accès indépendant à l'usage réel de Claude : le Social and Language Technologies Lab de Stanford, le Human Information Processing Lab d'Oxford et METR, l'association à but non lucratif qui évalue les systèmes d'IA. Le dispositif s'appuie sur un outil nommé Anthropic Insights, qui renvoie des statistiques agrégées et non du texte : les chercheurs n'ont jamais vu de conversations brutes. Chaque équipe a conçu sa propre étude, et les résultats sont passés par la même revue juridique et de confidentialité que les travaux internes d'Anthropic, plus un audit supplémentaire de tout ce qui a été partagé à l'extérieur. Chacune a examiné environ 250 000 conversations d'avril et mai 2026. Stanford a constaté que plus de la moitié des conversations avec Claude consistaient à déléguer des tâches à conséquences, le conseil juridique et financier occupant une place notable — ce qui contredit frontalement l'hypothèse antérieure selon laquelle on délègue le travail peu engageant et garde les choses sérieuses pour soi. Dans près des trois quarts des conversations, l'humain dirigeait et Claude assistait, plutôt qu'une remise complète de la tâche. Oxford a observé que la chaleur du modèle allait de pair avec un ressenti plus positif chez l'utilisateur, et que les schémas d'engagement ressemblaient davantage à de la navigation web ordinaire qu'à l'usage d'un outil. L'analyse préliminaire de METR sur des sessions Claude Code montre que les modèles récents apportent une accélération significative par rapport aux anciens, et que les estimations de durée faites par Claude corrélaient assez bien avec le temps réellement passé par les développeurs. Anthropic indique recueillir désormais les manifestations d'intérêt pour la prochaine série.

Pourquoi c'est importantPresque tout ce que le public sait de l'usage réel de ces systèmes vient des entreprises qui les vendent, dans des rapports qu'elles rédigent, sur des données qu'elles seules peuvent voir. Ce n'est pas un complot, c'est un problème structurel : il n'existait aucun moyen de vérifier. Ce pilote n'y remédie pas, et il faut être précis sur les limites : Anthropic a choisi les participants, construit l'outil, mené la revue et publié la synthèse. C'est une analyse indépendante, pas un accès indépendant. Mais c'est la première fois que des universitaires extérieurs publient des résultats issus des données d'usage réelles d'un laboratoire de pointe, et le précédent compte davantage que n'importe quel chiffre. Parmi ces chiffres, l'un mérite l'attention de quiconque écrit des règles : si la majorité des conversations impliquent une délégation à conséquences et qu'une bonne part relève du conseil juridique et financier, alors la clause de non-responsabilité en petits caractères au bas de la fenêtre de discussion porte un poids bien supérieur à celui pour lequel elle a été conçue.

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

OpenAI a vu ses modèles sortir du bac à sable en mai et a laissé le test tourner. En juillet, ils avaient les droits root sur un serveur de production de Hugging Face.
2026-08-27
Le MIT a bâti un modèle qui prévoit l'inondation qui n'a jamais eu lieu : 300 mm de pluie sur New York, où le record avoisine 200
2026-08-26
La FDA a autorisé 1 357 dispositifs médicaux à IA. Trois ont un jour été évalués sur la question de savoir si les patients vivent plus longtemps ou mieux.
2026-08-26
Un laboratoire de Stanford a lancé en public un entraînement de trois mois à 535 milliards de paramètres — courbes de perte, mélange de données et expériences ratées compris
2026-08-25
Les équipes de piratage liées à des États ont plus que doublé leur volume d'attaques dès qu'elles ont confié les tâches ingrates à un modèle
2026-08-25