{"id":"W4405703075","doi":"10.2196/57592","title":"Evaluating Bard Gemini Pro and GPT-4 Vision Against Student Performance in Medical Visual Question Answering: Comparative Case Study","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Rheinische Friedrich-Wilhelms-Universität Bonn","keywords":"Python (programming language); German; Visualization; Biostatistics; Computer science; Medical education; Artificial intelligence; Medicine; Psychology; Pathology; Geography; Public health; Programming language","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006466798,0.0001437306,0.0002692508,0.0005508505,0.0003084906,0.0001232314,0.00008545069,0.0001162598,0.00006078605],"category_scores_gemma":[0.0002659821,0.0001126308,0.00002730209,0.0008074607,0.0001971861,0.000489275,0.0001475105,0.001129491,0.00009048013],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004657771,"about_ca_system_score_gemma":0.000606952,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003987513,"about_ca_topic_score_gemma":0.000305474,"domain_scores_codex":[0.9964262,0.0006619718,0.000611735,0.0003583105,0.001510408,0.0004313749],"domain_scores_gemma":[0.998359,0.0007051014,0.00004234935,0.0001558035,0.0004734304,0.000264369],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000330175,0.001617923,0.0721835,0.0009981227,0.00004493032,0.001127986,0.4195845,0.00004475017,0.0002427793,0.00006562729,0.0002497408,0.5035099],"study_design_scores_gemma":[0.0004194412,0.01156893,0.138029,0.003049455,0.00001643145,0.0007697646,0.4040375,0.4399137,0.001549883,0.00006247426,0.0003553329,0.0002280191],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9956886,0.0003892469,0.00003915957,0.0007760558,0.0002383229,0.002171723,0.000001304489,0.00005034119,0.0006452905],"genre_scores_gemma":[0.998908,0.000177614,0.00004837057,0.0000400071,0.0002057386,0.0005264966,0.00001394284,0.00001384636,0.00006595071],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.503282,"threshold_uncertainty_score":0.4907141,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4498002325180859,"score_gpt":0.6832171400111745,"score_spread":0.2334169074930886,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}