{"id":"W4401367002","doi":"10.2196/63010","title":"Comparative Study to Evaluate the Accuracy of Differential Diagnosis Lists Generated by Gemini Advanced, Gemini, and Bard for a Case Report Series Analysis: Cross-Sectional Study","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Series (stratigraphy); Computer science; Data mining; Geology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001238585,0.0001826486,0.0005037706,0.0001829359,0.0002307787,0.0001289315,0.0001139892,0.00009669448,0.0001923251],"category_scores_gemma":[0.001341124,0.000116375,0.0001079882,0.0007098706,0.0001669378,0.0002530025,0.00008440779,0.0002896477,0.000008260699],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007870247,"about_ca_system_score_gemma":0.0003794772,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002484974,"about_ca_topic_score_gemma":0.0003882197,"domain_scores_codex":[0.997126,0.00008566614,0.001522733,0.0002192829,0.000818118,0.0002282003],"domain_scores_gemma":[0.9974927,0.001108616,0.0001893413,0.0003198854,0.000591008,0.0002984895],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.001132107,0.003376692,0.6468172,0.0008941753,0.003040197,0.0008916836,0.309193,0.0001513755,0.00003635558,0.00004117255,0.01078988,0.02363611],"study_design_scores_gemma":[0.001619184,0.01219767,0.2971035,0.0004912359,0.00446,0.005082222,0.5658613,0.103064,0.004205079,0.0001827924,0.004919132,0.0008139068],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9943042,0.0001473156,0.00104283,0.0005705072,0.0005039482,0.003288212,0.00006723488,0.0000449026,0.00003085607],"genre_scores_gemma":[0.9973494,0.00003551082,0.0002138353,0.0002026612,0.0002317385,0.001672736,0.0001432699,0.00001042838,0.0001404244],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3497137,"threshold_uncertainty_score":0.4745633,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1525138604214925,"score_gpt":0.5249425515847759,"score_spread":0.3724286911632834,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}