{"id":"W4409635101","doi":"10.3390/jpm15040160","title":"Multimodal Performance of GPT-4 in Complex Ophthalmology Cases","year":2025,"lang":"en","type":"article","venue":"Journal of Personalized Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Centre Hospitalier de l’Université de Montréal; Université de Montréal; St Mary's Hospital Centre; Hôpital du Sacré-Cœur de Montréal; Hôpital Maisonneuve-Rosemont; University of Waterloo; University of Toronto","funders":"","keywords":"Diagnostic accuracy; Medicine; Transformative learning; Context (archaeology); Artificial intelligence; Computer science; Psychology; Radiology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005093215,0.0008686462,0.0004934935,0.001576291,0.0002509357,0.001402637,0.001358374,0.001188205,0.006582565],"category_scores_gemma":[0.0359399,0.000225118,0.0009389615,0.0005204047,0.0005878816,0.001733231,0.003152353,0.00102989,0.002066676],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001033138,"about_ca_system_score_gemma":0.001103897,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002401586,"about_ca_topic_score_gemma":0.001997769,"domain_scores_codex":[0.9968078,0.001380429,0.0003424308,0.0006322631,0.0006415152,0.000195506],"domain_scores_gemma":[0.984547,0.01090967,0.001086025,0.001164564,0.0015128,0.0007801017],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00557829,0.001018889,0.1570796,0.001550757,0.0005675294,0.002131236,0.003821182,0.05640145,0.02147997,0.002070936,0.01695672,0.7313435],"study_design_scores_gemma":[0.0009973531,0.006435574,0.1971883,0.001101207,0.0008796328,0.007855948,0.004070254,0.6601423,0.05627629,0.01844817,0.04615635,0.0004485789],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9421688,0.0009690832,0.03423519,0.001047078,0.0001711914,0.0005855192,0.001861433,0.003942199,0.01501954],"genre_scores_gemma":[0.9446279,0.0003411446,0.05015345,0.0002797502,0.00006037205,0.0002636462,0.002525115,0.0001313011,0.001617379],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.006582565,"threshold_uncertainty_score":0.02693582,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2260285557914257,"score_gpt":0.4867686741261008,"score_spread":0.2607401183346751,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}