{"id":"W4413982530","doi":"10.1001/jamaophthalmol.2025.2918","title":"DeepSeek-R1 vs OpenAI o1 for Ophthalmic Diagnoses and Management Plans","year":2025,"lang":"en","type":"article","venue":"JAMA Ophthalmology","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; St. Michael's Hospital; Hôpital Maisonneuve-Rosemont; Centre Hospitalier de l’Université de Montréal; McGill University; University of Waterloo; University of Toronto","funders":"","keywords":"McNemar's test; Medicine; Medical diagnosis; Clinical Practice; Medical physics; Family medicine; Pathology; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03542539,0.001071679,0.001033782,0.001976314,0.0006255512,0.004105371,0.001875326,0.001167571,0.01384668],"category_scores_gemma":[0.2111605,0.0004445829,0.002572993,0.001219161,0.001064162,0.005611638,0.005302873,0.002291283,0.00196134],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003838303,"about_ca_system_score_gemma":0.005626566,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002902519,"about_ca_topic_score_gemma":0.004401444,"domain_scores_codex":[0.9705116,0.01709043,0.003051784,0.00256118,0.00601228,0.0007727499],"domain_scores_gemma":[0.7548606,0.2032588,0.02055503,0.01043207,0.007548353,0.003345194],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01254041,0.002467093,0.1826222,0.004681631,0.0009502248,0.0004749579,0.004518443,0.05419366,0.002940506,0.00896226,0.01691815,0.7087305],"study_design_scores_gemma":[0.006463138,0.02500328,0.2274885,0.00883205,0.003116289,0.003775766,0.01412816,0.5159876,0.02447975,0.0903832,0.07904292,0.001299274],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8961915,0.002355924,0.05233766,0.006435981,0.0002725505,0.002992984,0.005268932,0.004669843,0.0294746],"genre_scores_gemma":[0.8905522,0.0006576552,0.1026017,0.0008952486,0.0000887791,0.001085158,0.002082246,0.0003214103,0.001715606],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03542539,"threshold_uncertainty_score":0.1873496,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1100126829750908,"score_gpt":0.4478828120028748,"score_spread":0.337870129027784,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}