Specific Labs发布了Real-SWE测试,题目来自向真实公司授权取得的私有生产代码。八个前沿模型的完成率在百分之十六点二到百分之三十八点八之间,Claude Fable 5.1排在第一。GPT-6 Astra达到百分之三十三点八,Gemini 3.8 Flash为百分之三十一点二。
✓ 已核实 · 2个来源