{"id":"W4409712065","doi":"10.1002/jac5.70038","title":"Accuracy and reproducibility of <scp>ChatGPT</scp> responses to real‐world drug information questions","year":2025,"lang":"en","type":"article","venue":"JACCP JOURNAL OF THE AMERICAN COLLEGE OF CLINICAL PHARMACY","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institute for Clinical Evaluative Sciences; University of Toronto","funders":"","keywords":"Reproducibility; Drug; Computer science; Pharmacology; Chemistry; Chromatography; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.05523755,0.0004169957,0.0005084845,0.001188741,0.0005102579,0.001329855,0.00115317,0.001043435,0.004358281],"category_scores_gemma":[0.2031696,0.0003982372,0.0008513465,0.0009602362,0.001166381,0.001170654,0.001578763,0.00113164,0.001996741],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009597533,"about_ca_system_score_gemma":0.0008380816,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003991848,"about_ca_topic_score_gemma":0.003664565,"domain_scores_codex":[0.9330647,0.04075207,0.007370611,0.006563048,0.01106676,0.001182869],"domain_scores_gemma":[0.6316994,0.2652713,0.03619812,0.02758772,0.0367024,0.002540974],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.005170793,0.001269012,0.8487257,0.0007224481,0.0005801499,0.0001842415,0.01011345,0.003036587,0.004735439,0.0004259757,0.01309985,0.1119363],"study_design_scores_gemma":[0.0002055484,0.00203982,0.9723022,0.0002506905,0.0001386937,0.0002913807,0.001669773,0.01028304,0.006594211,0.0003968384,0.005734317,0.00009352731],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9802295,0.0001842945,0.006551395,0.0005790911,0.0002113962,0.001020555,0.002642763,0.0005446064,0.00803647],"genre_scores_gemma":[0.9909977,0.00006823646,0.004044905,0.0003609739,0.0000600032,0.001194658,0.001674709,0.0001003997,0.00149848],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9447625,"threshold_uncertainty_score":0.2921275,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1454278925233091,"score_gpt":0.5277380696326105,"score_spread":0.3823101771093014,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}