{"id":"W4389559041","doi":"10.2196/51391","title":"Learning to Make Rare and Complex Diagnoses With Generative AI Assistance: Qualitative Study of Popular Large Language Models","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":74,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Eberhard Karls Universität Tübingen","keywords":"Medical diagnosis; Leverage (statistics); Voting; Context (archaeology); Generative grammar; Computer science; Artificial intelligence; Machine learning; Psychology; Medical education; Medicine; Geography; Political science; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005482895,0.0001078862,0.0002454077,0.0001754022,0.0001319047,0.00001441153,0.00005587742,0.00007837854,0.0001418126],"category_scores_gemma":[0.0008687862,0.00008578542,0.00001908171,0.0005687005,0.00005562273,0.00007862026,0.00002633811,0.0002479747,0.00001744813],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006814264,"about_ca_system_score_gemma":0.0006367269,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005918205,"about_ca_topic_score_gemma":0.000903845,"domain_scores_codex":[0.9984283,0.0002387202,0.0003319859,0.0002638089,0.00053428,0.0002029231],"domain_scores_gemma":[0.9989852,0.0001610402,0.00009200186,0.0001599066,0.0003073232,0.0002944925],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0001850295,0.001470146,0.01945023,0.0001942951,0.00003914403,0.00001207244,0.9236828,0.00003881863,0.000133807,0.0006795465,0.006831682,0.04728244],"study_design_scores_gemma":[0.0002006832,0.001332879,0.0262881,0.0003010923,0.00003143423,0.000006039708,0.9674521,0.002659349,0.0001243751,0.00040509,0.001087835,0.0001110418],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9869105,0.0001181636,0.0004459444,0.01117341,0.0001732218,0.000975792,0.000004389813,0.00005713376,0.000141462],"genre_scores_gemma":[0.9961954,0.00003023629,0.0003380374,0.001766379,0.0002392782,0.0004685307,0.0001878375,0.00001703426,0.0007572485],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0471714,"threshold_uncertainty_score":0.3498228,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.129287724422895,"score_gpt":0.5182458280781091,"score_spread":0.3889581036552142,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}