Specific Labs a publié Real-SWE, une épreuve bâtie sur du code privé cédé par de vraies entreprises. Huit modèles de pointe ont résolu entre 16,2 et 38,8 pour cent des tâches proposées. Claude Fable 5.1 arrive en tête, devant GPT-6 Astra et Gemini 3.8 Flash.