Anthropic publicó el 26 de agosto los resultados de un piloto que dio a tres grupos externos acceso independiente al uso real de Claude: el Social and Language Technologies Lab de Stanford, el Human Information Processing Lab de Oxford y METR, la organización sin ánimo de lucro que evalúa sistemas de IA. El mecanismo es una herramienta llamada Anthropic Insights, que devuelve estadísticas agregadas en lugar de texto: los investigadores nunca vieron conversaciones en bruto. Cada equipo diseñó su propio estudio y los resultados pasaron por la misma revisión legal y de privacidad que el trabajo interno de Anthropic, más una auditoría adicional de todo lo compartido fuera. Cada uno examinó alrededor de 250.000 conversaciones de abril y mayo de 2026. Stanford halló que más de la mitad de las conversaciones con Claude implicaban delegar tareas con consecuencias, con la orientación jurídica y financiera en lugar destacado, lo que contradice de lleno la suposición previa de que la gente delega lo de baja responsabilidad y se guarda lo serio. En cerca de tres cuartas partes de las conversaciones era el humano quien dirigía y Claude quien asistía, y no una entrega íntegra de la tarea. Oxford encontró que la calidez del modelo iba acompañada de un afecto más positivo en el usuario, y que los patrones de interacción se parecían más a la navegación web corriente que al uso de una herramienta. El análisis preliminar de METR sobre sesiones de Claude Code halló que los modelos nuevos aportan una aceleración significativa frente a los antiguos, y que las propias estimaciones de tiempo de Claude se correlacionaban razonablemente con lo que los desarrolladores tardaron de verdad. Anthropic dice que ya recibe manifestaciones de interés para la siguiente ronda.