Investigadores de Stanford sometieron nueve modelos a 508 preguntas sobre historiales reales de pacientes. Médicos revisaron las preguntas; la mejor ronda halló el 78% de los datos y la peor, el 43%. Las notas bajaron más cuando la respuesta exigía juntar varias consultas distintas.