{"id":"W4411208812","doi":"10.3138/cjgim.2024.0017","title":"Assessing the accuracy of ChatGPT responses to guideline-based inquiries: A cross-sectional study","year":2025,"lang":"en","type":"article","venue":"Canadian Journal of General Internal Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; McMaster University","funders":"","keywords":"Medicine; Guideline; Cross-sectional study; Environmental health; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0595957,0.0003558201,0.001036451,0.002798683,0.000780867,0.001870492,0.001216656,0.001303267,0.001263428],"category_scores_gemma":[0.1921845,0.0008503529,0.001628602,0.002519476,0.001203022,0.002126739,0.001909098,0.001226183,0.0005048455],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0011597,"about_ca_system_score_gemma":0.001078646,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003724101,"about_ca_topic_score_gemma":0.003110179,"domain_scores_codex":[0.9414648,0.03051365,0.01257563,0.004493915,0.0098322,0.00111968],"domain_scores_gemma":[0.6904429,0.187842,0.08128251,0.01178331,0.02638736,0.002261962],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001436558,0.0000899724,0.994191,0.0001145429,0.0002334492,0.00004182724,0.0027187,0.00005067269,0.00008493746,0.00003151736,0.0001768865,0.002122789],"study_design_scores_gemma":[0.00004008114,0.0006364174,0.9933792,0.0002108313,0.0001985579,0.0004609586,0.003109904,0.0009488109,0.0002008718,0.00006865722,0.0007182123,0.00002741812],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.997754,0.0003522198,0.0006073037,0.0001321013,0.00001890228,0.0001857994,0.0003739337,0.000009710815,0.0005659619],"genre_scores_gemma":[0.9979689,0.0001677744,0.0008808702,0.000140051,0.00001832623,0.000280309,0.0004299764,0.000007154549,0.0001065723],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0595957,"threshold_uncertainty_score":0.3151759,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2383992306738587,"score_gpt":0.5412869266274479,"score_spread":0.3028876959535893,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}