{"id":"W4388879751","doi":"10.1097/iop.0000000000002552","title":"Evaluating ChatGPT on Orbital and Oculofacial Disorders: Accuracy and Readability Insights","year":2023,"lang":"en","type":"article","venue":"Ophthalmic Plastic and Reconstructive Surgery","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Ottawa Hospital; Queen's University; University of Ottawa; Dalhousie University; University of Toronto","funders":"","keywords":"Readability; Medicine; Intraclass correlation; Reliability (semiconductor); Likert scale; Artificial intelligence; Statistics; Medical physics; Natural language processing; Psychometrics; Computer science; Clinical psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01972254,0.0008480917,0.0007995531,0.003081683,0.0003345257,0.001455256,0.0006795287,0.0007980661,0.00221367],"category_scores_gemma":[0.1137734,0.0002174592,0.001159651,0.001290025,0.0007026735,0.001160554,0.001853681,0.0006557982,0.0008241695],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008418052,"about_ca_system_score_gemma":0.0006235939,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00216456,"about_ca_topic_score_gemma":0.002860956,"domain_scores_codex":[0.9830876,0.009322182,0.002106704,0.001242942,0.003798655,0.0004419177],"domain_scores_gemma":[0.8209283,0.1395284,0.01366111,0.006153665,0.01811224,0.001616375],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002080512,0.0005344542,0.7893613,0.0009251443,0.000427653,0.0004933858,0.01166139,0.004275464,0.007484324,0.0002848468,0.003875482,0.178596],"study_design_scores_gemma":[0.00009738853,0.001512591,0.957755,0.0004256887,0.0001895308,0.0009991395,0.0042238,0.02173617,0.007702792,0.0007101628,0.004526988,0.0001207093],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.984663,0.0003339854,0.008121748,0.0001798381,0.00006450615,0.0004654681,0.0009980248,0.0004450065,0.0047283],"genre_scores_gemma":[0.9879683,0.0002507963,0.008555143,0.0001345164,0.00005174941,0.0005830911,0.001174447,0.00007764308,0.001204306],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01972254,"threshold_uncertainty_score":0.104304,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1639992599863989,"score_gpt":0.4172744711122012,"score_spread":0.2532752111258023,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}