{"id":"W4389559041","doi":"10.2196/51391","title":"Learning to Make Rare and Complex Diagnoses With Generative AI Assistance: Qualitative Study of Popular Large Language Models","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":74,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Eberhard Karls Universität Tübingen","keywords":"Medical diagnosis; Leverage (statistics); Voting; Context (archaeology); Generative grammar; Computer science; Artificial intelligence; Machine learning; Psychology; Medical education; Medicine; Geography; Political science; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03338028,0.0007323118,0.0004218778,0.001495544,0.001663848,0.003733185,0.002476658,0.001858892,0.002797262],"category_scores_gemma":[0.1372933,0.0004248733,0.0006381801,0.0008450755,0.004348677,0.006573423,0.004120114,0.002833913,0.0006703205],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003017248,"about_ca_system_score_gemma":0.002527532,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003967381,"about_ca_topic_score_gemma":0.006403429,"domain_scores_codex":[0.973459,0.02242676,0.0004565124,0.00125291,0.001956317,0.0004485116],"domain_scores_gemma":[0.8053564,0.1826618,0.003025109,0.003635364,0.004180226,0.001141112],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0003987534,0.0006137411,0.1228942,0.001282156,0.0001434767,0.003744395,0.6692993,0.01858617,0.005858127,0.02821168,0.01153321,0.1374348],"study_design_scores_gemma":[0.0001651016,0.0006793649,0.02563201,0.001703144,0.0002615739,0.004873261,0.463421,0.3010975,0.01086861,0.06355662,0.1273679,0.0003737943],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8874233,0.001015488,0.08865675,0.009016899,0.00006623143,0.0004723519,0.0005366998,0.0004785287,0.01233384],"genre_scores_gemma":[0.9775208,0.000267487,0.02000234,0.0006737942,0.00001409621,0.000145914,0.0002644831,0.0001057791,0.001005346],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03338028,"threshold_uncertainty_score":0.1765339,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.129287724422895,"score_gpt":0.5182458280781091,"score_spread":0.3889581036552142,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}