Una nueva prueba llamada Thinkingbox ejecutó 507 flujos de trabajo veinte veces desde cero. Claude Opus 5 resolvió el 66,5 por ciento una vez y el 47,5 en los veinte intentos. Kimi K3 cayó más, del 57,4 al 17,6 por ciento, así que la brecha es la fiabilidad.