{"id":"W4405703075","doi":"10.2196/57592","title":"Evaluating Bard Gemini Pro and GPT-4 Vision Against Student Performance in Medical Visual Question Answering: Comparative Case Study","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Rheinische Friedrich-Wilhelms-Universität Bonn","keywords":"Python (programming language); German; Visualization; Biostatistics; Computer science; Medical education; Artificial intelligence; Medicine; Psychology; Pathology; Geography; Public health; Programming language","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01028947,0.0009779647,0.0009261969,0.001920371,0.0003622891,0.001777764,0.001617957,0.001612684,0.002534267],"category_scores_gemma":[0.03632903,0.0002807383,0.0008419646,0.0009051278,0.0008517437,0.001829449,0.002625236,0.00133222,0.001871762],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001469916,"about_ca_system_score_gemma":0.001248866,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003781644,"about_ca_topic_score_gemma":0.004895825,"domain_scores_codex":[0.9903585,0.004593229,0.0007848528,0.001275933,0.002406411,0.0005810016],"domain_scores_gemma":[0.9672399,0.02184884,0.001739622,0.001557426,0.004861778,0.002752464],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01009178,0.0133553,0.2990454,0.003002167,0.0006492942,0.001990317,0.01674223,0.02523923,0.01548601,0.00186879,0.02421107,0.5883183],"study_design_scores_gemma":[0.001428816,0.03616448,0.5356494,0.0009583581,0.0008945907,0.004484885,0.01396193,0.2955191,0.05359512,0.004213554,0.05253591,0.0005938132],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9911487,0.000430248,0.003606492,0.0002449455,0.00004649036,0.00030529,0.0007528519,0.000614466,0.002850604],"genre_scores_gemma":[0.9814332,0.0002580881,0.01341318,0.0001646016,0.00005083316,0.0004032182,0.002514644,0.0001122804,0.001650008],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01028947,"threshold_uncertainty_score":0.05441654,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4498002325180859,"score_gpt":0.6832171400111745,"score_spread":0.2334169074930886,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}