Die Prüffirma Arena veröffentlichte am Donnerstag einen Alignment-Index und sammelte 200 Millionen Dollar ein. Sie bewertete 27 Modelle in 90.000 echten Agentensitzungen und gewichtete unerlaubte Aktionen mit der Hälfte. OpenAIs GPT-6.1 Sol führte mit 87,9 Punkten, knapp vor Anthropics Claude Opus 5.5.