{"id":"W4412552687","doi":"10.3390/jcm14155175","title":"ChatGPT-4o and OpenAI-o1: A Comparative Analysis of Its Accuracy in Refractive Surgery","year":2025,"lang":"en","type":"article","venue":"Journal of Clinical Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; McGill University","funders":"American Academy of Ophthalmology","keywords":"Medicine; Pairwise comparison; Confidence interval; Statistical significance; Margin (machine learning); Statistics; Medical physics; Machine learning; Mathematics; Computer science; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01722454,0.001166042,0.001149255,0.001734637,0.0003556842,0.001792023,0.001096742,0.00120509,0.001991408],"category_scores_gemma":[0.09691696,0.0004075261,0.001651402,0.000798612,0.0009330142,0.002065974,0.001907523,0.0009486575,0.0006858174],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001130754,"about_ca_system_score_gemma":0.001343104,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004515469,"about_ca_topic_score_gemma":0.003695359,"domain_scores_codex":[0.9868222,0.007753456,0.001053029,0.001330266,0.00260262,0.0004383858],"domain_scores_gemma":[0.8579099,0.1243771,0.007857223,0.002714791,0.004803693,0.00233735],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01569592,0.001395747,0.8010721,0.001382881,0.001154021,0.0002478371,0.004004048,0.01745952,0.001944445,0.0005111313,0.002230122,0.1529022],"study_design_scores_gemma":[0.001111118,0.01552681,0.7111335,0.0008236825,0.001618487,0.001355364,0.003605753,0.2514022,0.007308587,0.00167482,0.003976699,0.0004628722],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9913836,0.0007026894,0.00406808,0.000233327,0.0000565396,0.0002452177,0.0004577404,0.0002508881,0.002602001],"genre_scores_gemma":[0.994001,0.000383644,0.004212902,0.00008328712,0.00003710012,0.00018424,0.0005235427,0.00004087802,0.0005334172],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01722454,"threshold_uncertainty_score":0.09109312,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.526995482601098,"score_gpt":0.640504456707651,"score_spread":0.113508974106553,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}