{"id":"W4409635101","doi":"10.3390/jpm15040160","title":"Multimodal Performance of GPT-4 in Complex Ophthalmology Cases","year":2025,"lang":"en","type":"article","venue":"Journal of Personalized Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Centre Hospitalier de l’Université de Montréal; Université de Montréal; St Mary's Hospital Centre; Hôpital du Sacré-Cœur de Montréal; Hôpital Maisonneuve-Rosemont; University of Waterloo; University of Toronto","funders":"","keywords":"Diagnostic accuracy; Medicine; Transformative learning; Context (archaeology); Artificial intelligence; Computer science; Psychology; Radiology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007638456,0.00009806275,0.0005860503,0.0005171583,0.00003210477,0.000001746644,0.00009195688,0.00008784601,0.0008727655],"category_scores_gemma":[0.001084328,0.00007108461,0.00008044569,0.0004044529,0.000283431,0.00005996186,0.00001148316,0.0003010324,0.000002966112],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000134309,"about_ca_system_score_gemma":0.0004749408,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005486253,"about_ca_topic_score_gemma":0.00001159185,"domain_scores_codex":[0.9984513,0.0000698617,0.0009351729,0.00009921673,0.0002712591,0.0001731863],"domain_scores_gemma":[0.9985438,0.0003913785,0.0003299811,0.0001181231,0.0005138688,0.0001028371],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.006250835,0.0008274603,0.883339,0.001468897,0.0001701649,0.0008538743,0.008456463,0.00006229404,0.03680777,0.0007401052,0.008262577,0.05276049],"study_design_scores_gemma":[0.005673735,0.01238474,0.8789693,0.008682901,0.0006399574,0.01455315,0.02795614,0.006261188,0.02032289,0.001163704,0.02306634,0.0003259536],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.985437,0.00200219,0.00006009591,0.009996618,0.0005363669,0.0001547269,0.000001022093,0.000003276364,0.001808729],"genre_scores_gemma":[0.9970194,0.000465378,0.0007970901,0.0006948143,0.0003482555,0.00000278953,0.000005404506,0.000006008276,0.0006608284],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05243454,"threshold_uncertainty_score":0.955617,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2260285557914257,"score_gpt":0.4867686741261008,"score_spread":0.2607401183346751,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}