{"id":"W4407421534","doi":"10.2196/71664","title":"Correction: Evaluating Bard Gemini Pro and GPT-4 Vision Against Student Performance in Medical Visual Question Answering: Comparative Case Study","year":2025,"lang":"en","type":"erratum","venue":"JMIR Formative Research","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"","funders":"","keywords":"Information retrieval; Computer science; Medical physics; Optometry; Medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.01010791,0.0004717794,0.0007937363,0.001292456,0.0009998297,0.0007031394,0.0009546229,0.0004265297,0.00001456071],"category_scores_gemma":[0.000364048,0.0004106943,0.00007981889,0.001480574,0.0001739854,0.001112393,0.001815839,0.004780343,0.00004055772],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009512544,"about_ca_system_score_gemma":0.001080693,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003076851,"about_ca_topic_score_gemma":0.0002412937,"domain_scores_codex":[0.9907085,0.002869304,0.001049911,0.001007647,0.003526773,0.0008378158],"domain_scores_gemma":[0.9968209,0.0009303942,0.0003403946,0.0004956599,0.00117172,0.0002409141],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002646298,0.003930281,0.01267682,0.002592116,0.0004231029,0.0049773,0.5455901,0.001811787,0.00002243217,0.002119431,0.1101511,0.315441],"study_design_scores_gemma":[0.001350329,0.006937788,0.02515585,0.009678033,0.00001124118,0.0005182882,0.06252562,0.8502344,0.00004286389,0.00001105154,0.04277727,0.0007572593],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9303846,0.0008583062,0.009441323,0.0002085238,0.02360766,0.005459465,0.000005102559,0.0002548876,0.02978007],"genre_scores_gemma":[0.9574546,0.0001678577,0.0001220318,0.00002102774,0.0005976818,0.0007227552,0.00002314477,0.00002231861,0.04086862],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8484226,"threshold_uncertainty_score":0.9998345,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09632221086965453,"score_gpt":0.505090904754585,"score_spread":0.4087686938849304,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}