La société d'évaluation Arena a publié jeudi un Indice d'alignement et levé 200 millions de dollars. Elle a noté 27 modèles sur 90 000 vraies sessions d'agents, les actions non autorisées comptant pour moitié. Le GPT-6.1 Sol d'OpenAI mène avec 87,9 points, juste devant le Claude Opus 5.5 d'Anthropic.