Des chercheurs de Stanford ont soumis neuf modèles à 508 questions sur de vrais dossiers médicaux. Des médecins ont validé les questions; la meilleure série a retrouvé 78% des faits, la pire 43%. Les scores chutaient encore quand la réponse exigeait de relier plusieurs consultations.