La firma de herramientas para desarrolladores Scale X convirtió las solicitudes de permiso de los agentes de IA en un juego de navegador y analizó más de 40.000 partidas con 409.000 decisiones de aprobar/denegar. La precisión media fue del 66,3%: los jugadores aprobaron aproximadamente uno de cada tres comandos maliciosos y un tercio de las sesiones terminó con puntuación negativa. La vigilancia decayó a medida que se acumulaban aprobaciones, y la amenaza más pasada por alto — un script 'npm run analyze' capaz de ejecutar código arbitrario — fue aprobada casi el 65% de las veces.