Stanford'daki araştırmacılar dokuz modele gerçek hasta kayıtlarından 508 soru sordu. Soruları hekimler denetledi; en iyi deneme gereken bilgilerin %78'ini, en kötüsü %43'ünü buldu. Cevap birkaç ayrı muayeneyi birleştirmeyi gerektirdiğinde puanlar daha da düştü.