Investigación
AI Minute Newsroom
2026-08-29
Anthropic soltó a Claude sobre diez de sus propios fallos de alineamiento. En la tarea de engaño sacó 85 donde 28 investigadores humanos de seguridad sacaron 20.
En un artículo publicado el 28 de agosto, Anthropic describe lo que llama un investigador automático de alineamiento: Claude lee la literatura sobre un desalineamiento concreto, propone un método de entrenamiento, lo ejecuta durante unos treinta minutos, lee la puntuación del banco de pruebas y vuelve a intentarlo. En diez categorías de fallo de alineamiento —cada una medida con tres a cinco bancos de pruebas— cerró entre el 26 y el 96 por ciento de la brecha de seguridad sin degradar las capacidades generales del modelo. En la tarea de engaño alcanzó el 85 por ciento en varias ejecuciones; 28 investigadores humanos de seguridad, con hasta ocho horas cada uno, llegaron al 20. Los métodos que encontró se generalizaron a modelos hasta 4,7 veces mayores que aquellos sobre los que se desarrollaron. En la única prueba a escala de producción, Claude Sonnet 5 cerró el 65 por ciento de la brecha de seguridad que quedaba en un punto de control temprano de Claude Opus 4.8 en 60 horas, quedando cerca de las puntuaciones de los modelos ya publicados. El trabajo lo dirigió un becario de Anthropic, Chen Yueh-Han, y se probó en Gemma-2-2B además del punto de control de Opus.
Por qué importaAnthropic aclara que la comparación con humanos no es una pelea justa: los investigadores enviaron una idea cada uno y no pudieron iterar, mientras que la máquina repitió el bucle cientos de veces, así que el artículo presenta el resultado como argumento a favor de la colaboración y no del reemplazo. Aceptado eso, el hallazgo sigue importando, porque la asimetría que señala es real. Si los modelos siguen mejorando en construir modelos, el trabajo de alineamiento tiene que acelerarse al mismo ritmo o se queda atrás, y este es el primer intento publicado de mostrar que la mitad de esa carrera dedicada a la seguridad también puede automatizarse. Las salvedades que ponen los autores son las que conviene retener: los fallos probados son estrechos comparados con lo que hacen los sistemas en producción, todavía no hay bancos de pruebas para los fallos que nadie ha visto, y no comprobaron si las correcciones sobreviven al aprendizaje por refuerzo intensivo que viene después.
✓ Verificado · 2 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
Z.ai abrió los pesos de GLM-5.3 el día prometido, y dejó caer sin ruido la licencia MIT con la que salieron sus tres modelos anteriores
2026-08-29El truco de la banda de ransomware fue una frase: decirle al agente de programación que era una prueba. Después pasó seis semanas dentro de redes de empresas reales.
2026-08-28Google Search vigilará por ti el precio de los vuelos y reservará el hotel: la conversación acaba en una reserva, no en una lista de enlaces
2026-08-28El protocolo que dejó a la IA tocar tus archivos ya tiene un hermano para el equipamiento de laboratorio: Anthropic quiere que un modelo maneje un microscopio como maneja una aplicación
2026-08-28Los laboratorios cuyos modelos se escaparon y atacaron a empresas reales firman ahora una carta pidiendo al mundo que se dé prisa en defenderse
2026-08-28