Лучший кодовый агент решил 39% реальных рабочих задач.
Specific Labs выпустила Real-SWE, тест на закрытом рабочем коде реальных компаний. Восемь передовых моделей решили от 16,2 до 38,8 процента заданий. Первое место занял Claude Fable 5.1, за ним GPT-6 Astra и Gemini 3.8 Flash.
Почему это важноОценки, которые вы читаете, получены на аккуратных публичных репозиториях. Это и есть разрыв между демонстрацией и кодом, который ведет ваша команда.