{"id":"W4400930166","doi":"10.1111/odi.15082","title":"Innovating dental diagnostics: ChatGPT's accuracy on diagnostic challenges","year":2024,"lang":"en","type":"article","venue":"Oral Diseases","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":16,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; Western University","funders":"","keywords":"Medical diagnosis; Diagnostic accuracy; Diagnostic test; Medicine; Medical physics; Test (biology); Differential diagnosis; Pediatrics; Radiology; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02483122,0.0006133532,0.0007386837,0.004759169,0.0007700517,0.003317668,0.001382101,0.001361705,0.003966838],"category_scores_gemma":[0.1472599,0.0002956773,0.0008574271,0.001876788,0.001284088,0.002789486,0.00406203,0.0008281316,0.001249495],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00101675,"about_ca_system_score_gemma":0.001389703,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001626186,"about_ca_topic_score_gemma":0.002432829,"domain_scores_codex":[0.979844,0.01025333,0.002317081,0.00175678,0.004840934,0.0009879386],"domain_scores_gemma":[0.8511883,0.1164151,0.01044108,0.006027493,0.01328419,0.002643765],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001146065,0.0001857058,0.7464684,0.001075425,0.0002237608,0.00090257,0.005519395,0.001645216,0.003525299,0.001249666,0.004176611,0.2338818],"study_design_scores_gemma":[0.0001071808,0.0021325,0.8232157,0.001892179,0.001072153,0.01168354,0.02085959,0.07784647,0.02003377,0.009142305,0.03165447,0.0003600627],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.951653,0.003137829,0.024095,0.002297221,0.0004310234,0.0005259407,0.001349784,0.0009424491,0.01556788],"genre_scores_gemma":[0.9828587,0.0003817711,0.01547483,0.0001745985,0.00007220294,0.00008881113,0.0003982755,0.00003697386,0.0005140232],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02483122,"threshold_uncertainty_score":0.1313216,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1667445600766599,"score_gpt":0.4452014181101006,"score_spread":0.2784568580334406,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}