Specific Labs publicó Real-SWE, una prueba hecha con código privado licenciado a empresas reales. Ocho modelos punteros resolvieron entre el 16,2 y el 38,8 por ciento de las tareas. Claude Fable 5.1 quedó primero, seguido de GPT-6 Astra y Gemini 3.8 Flash.