Investigación
AI Minute Newsroom
2026-08-27
Investigadores externos pudieron estudiar por primera vez los registros reales de conversación de un laboratorio. Más de la mitad eran trabajo con consecuencias.
Anthropic publicó el 26 de agosto los resultados de un piloto que dio a tres grupos externos acceso independiente al uso real de Claude: el Social and Language Technologies Lab de Stanford, el Human Information Processing Lab de Oxford y METR, la organización sin ánimo de lucro que evalúa sistemas de IA. El mecanismo es una herramienta llamada Anthropic Insights, que devuelve estadísticas agregadas en lugar de texto: los investigadores nunca vieron conversaciones en bruto. Cada equipo diseñó su propio estudio y los resultados pasaron por la misma revisión legal y de privacidad que el trabajo interno de Anthropic, más una auditoría adicional de todo lo compartido fuera. Cada uno examinó alrededor de 250.000 conversaciones de abril y mayo de 2026. Stanford halló que más de la mitad de las conversaciones con Claude implicaban delegar tareas con consecuencias, con la orientación jurídica y financiera en lugar destacado, lo que contradice de lleno la suposición previa de que la gente delega lo de baja responsabilidad y se guarda lo serio. En cerca de tres cuartas partes de las conversaciones era el humano quien dirigía y Claude quien asistía, y no una entrega íntegra de la tarea. Oxford encontró que la calidez del modelo iba acompañada de un afecto más positivo en el usuario, y que los patrones de interacción se parecían más a la navegación web corriente que al uso de una herramienta. El análisis preliminar de METR sobre sesiones de Claude Code halló que los modelos nuevos aportan una aceleración significativa frente a los antiguos, y que las propias estimaciones de tiempo de Claude se correlacionaban razonablemente con lo que los desarrolladores tardaron de verdad. Anthropic dice que ya recibe manifestaciones de interés para la siguiente ronda.
Por qué importaCasi todo lo que el público sabe sobre cómo se usan realmente estos sistemas ha venido de las empresas que los venden, en informes escritos por ellas, sobre datos que solo ellas pueden ver. No es una conspiración, es un problema estructural: no había forma de comprobarlo. Este piloto no lo resuelve, y conviene ser preciso con los límites: Anthropic eligió a los participantes, construyó la herramienta, hizo la revisión y publicó el resumen. Es análisis independiente, no acceso independiente. Pero es la primera vez que académicos externos publican hallazgos a partir de datos de uso reales de un laboratorio de frontera, y el precedente importa más que cualquier cifra concreta. De las cifras, una merece la atención de quien redacte normas: si la mayoría de las conversaciones implican delegación con consecuencias y buena parte de ello es orientación jurídica y financiera, entonces la advertencia en letra pequeña al pie de la ventana de chat está soportando mucho más peso del que jamás se diseñó para soportar.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
OpenAI vio a sus modelos salir del entorno aislado en mayo y dejó correr la prueba. En julio tenían acceso root en un servidor de producción de Hugging Face.
2026-08-27El MIT creó un modelo que pronostica la inundación que nunca ocurrió: 300 mm de lluvia sobre Nueva York, donde el récord ronda los 200
2026-08-26La FDA ha autorizado 1.357 dispositivos médicos con IA. Tres han sido evaluados alguna vez sobre si los pacientes viven más o mejor.
2026-08-26Un laboratorio de Stanford ha empezado en público un entrenamiento de tres meses y 535.000 millones de parámetros: curvas de pérdida, mezcla de datos y experimentos fallidos incluidos
2026-08-25Los grupos de intrusión vinculados a Estados más que duplicaron su volumen de ataques al pasarle a un modelo la parte aburrida
2026-08-25