{"id":"W4407394923","doi":"10.1101/2025.02.10.25322041","title":"Performance of DeepSeek-R1 in Ophthalmology: An Evaluation of Clinical Decision-Making and Cost-Effectiveness","year":2025,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Health Systems, Economic Evaluations, Quality of Life","field":"Economics, Econometrics and Finance","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; McGill University; University of Waterloo; University of Toronto","funders":"","keywords":"Clinical decision making; Optometry; Ophthalmology; Psychology; Medicine; Family medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","metaepi_narrow"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1093732,0.0002452417,0.002252485,0.0007707601,0.00005352582,0.00001962747,0.000465254,0.0005775819,0.0001471899],"category_scores_gemma":[0.0175852,0.0003148055,0.0001581889,0.0002374324,0.0001706691,0.0002388106,0.0003483438,0.0005076377,0.00002169877],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003414169,"about_ca_system_score_gemma":0.0007014183,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003463359,"about_ca_topic_score_gemma":0.0001066559,"domain_scores_codex":[0.9886107,0.002641562,0.007276569,0.0009761485,0.0002165107,0.0002784877],"domain_scores_gemma":[0.9887269,0.005740614,0.004197839,0.0009075353,0.0003345182,0.00009262137],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001080847,0.0001767444,0.9791749,0.001568002,0.00005606876,7.772896e-7,0.0004244543,0.008759945,0.000001024111,0.001455177,0.00001800198,0.008256824],"study_design_scores_gemma":[0.0009246318,0.0001106609,0.8081815,0.001451946,0.00002467507,0.000002948676,0.00009149985,0.1744154,0.000006691586,0.01453235,0.00006732402,0.0001903953],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9916902,0.00192038,0.0007198322,0.0002300232,0.001359926,0.002028585,0.0002164724,0.00001199042,0.001822653],"genre_scores_gemma":[0.9963273,0.0002762319,0.002787461,0.0001360415,0.0001030293,0.0003095929,0.00002921072,0.0000193324,0.00001178205],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1709934,"threshold_uncertainty_score":0.9999304,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5560535159959448,"score_gpt":0.5644865920010473,"score_spread":0.008433076005102569,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}