La firma de evaluación Arena publicó el jueves un Índice de Alineación junto a una ronda de 200 millones. Puntuó 27 modelos en 90.000 sesiones reales de agentes y las acciones no autorizadas pesaron la mitad. El GPT-6.1 Sol de OpenAI lideró con 87,9 puntos, justo por delante del Claude Opus 5.5 de Anthropic.