aiminute. ← Todas las noticias de IA
Investigación AI Minute Newsroom 2026-08-29

Investigadores entregaron 70 piezas de su propio trabajo de laboratorio como examen. El mejor agente de IA terminó el 30 por ciento.

Investigadores entregaron 70 piezas de su propio trabajo de laboratorio como examen. El mejor agente de IA terminó el 30 por ciento.

Terminal-Bench-Science 0.1, publicado esta semana por investigadores de Stanford junto con los equipos de Terminal-Bench y Harbor, es un banco de pruebas construido con trabajo que los científicos hacen de verdad. Cada una de sus 70 tareas fue aportada por un investigador que tomó un flujo de trabajo computacional de su propio laboratorio y lo convirtió en algo que un agente puede intentar en una terminal, en ciencias de la vida, físicas, de la Tierra, matemáticas e ingeniería. Cada tarea corre en un contenedor y se verifica programáticamente, de modo que la nota mide si el trabajo salió bien, no si el agente dijo que lo hizo. Los resultados son bajos a propósito: Claude Opus 5 encabeza con un 30,0 por ciento de resolución, GPT-5.6 Sol obtiene 22,4 por ciento y Claude Fable 5, 21,4 por ciento. Todos los modelos puntuaron más de diez puntos por debajo del Terminal-Bench 3.0 general. El proyecto enumera 376 contribuyentes de 22 países y está recogiendo tareas para la versión 0.2, con fecha límite el 5 de octubre.

Por qué importaLa idea de que la IA está a punto de acelerar la ciencia suele apoyarse en pruebas tipo examen: preguntas con respuesta conocida, del tipo que a un científico dejaron de hacerle hace años. Esto mide lo otro: si el sistema puede ejecutar la tubería, manejar los formatos de archivo, notar que un paso falló y producir un resultado que un investigador aceptaría. El treinta por ciento es una cifra real sobre la que mejorar, no una saturada, y como las tareas vienen de colaboradores con nombre en campos concretos, los fallos señalan a algún sitio: se puede ver en qué ciencias los agentes son peores, en lugar de saber únicamente que lo son.
#Agentes IA#Ciencia e Investigación

✓ Verificado · 4 fuentes

WhatsApp X Telegram
Léelo en la app — gratis, en 9 idiomas

Noticias relacionadas

El modelo por defecto de Slack ahora es Claude, y el trabajo comercial de Salesforce se ha empaquetado en 37 habilidades que se ejecutan desde dentro del chatbot
2026-08-29
Anthropic soltó a Claude sobre diez de sus propios fallos de alineamiento. En la tarea de engaño sacó 85 donde 28 investigadores humanos de seguridad sacaron 20.
2026-08-29
Z.ai abrió los pesos de GLM-5.3 el día prometido, y dejó caer sin ruido la licencia MIT con la que salieron sus tres modelos anteriores
2026-08-29
El truco de la banda de ransomware fue una frase: decirle al agente de programación que era una prueba. Después pasó seis semanas dentro de redes de empresas reales.
2026-08-28
Google Search vigilará por ti el precio de los vuelos y reservará el hotel: la conversación acaba en una reserva, no en una lista de enlaces
2026-08-28