{"id":"W4385236544","doi":"10.2196/48433","title":"Examining Real-World Medication Consultations and Drug-Herb Interactions: ChatGPT Performance Evaluation","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":46,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"China Medical University; China Medical University Hospital","keywords":"Pharmacist; Medicine; Pharmacy; Family medicine; Set (abstract data type); Computer science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001640948,0.0001361989,0.0001819295,0.0005592589,0.000281668,0.00003432922,0.00008088329,0.0001122025,0.001232583],"category_scores_gemma":[0.002563249,0.0001309729,0.00002833429,0.001135943,0.0001554778,0.000317411,0.0000258246,0.0003490985,0.0004132569],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00030241,"about_ca_system_score_gemma":0.0029284,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006032292,"about_ca_topic_score_gemma":0.0003935782,"domain_scores_codex":[0.9977736,0.0001472097,0.0005816186,0.000358585,0.0008823992,0.0002565687],"domain_scores_gemma":[0.9980431,0.0004817532,0.0001808713,0.0002765052,0.0006015053,0.0004162917],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0000389087,0.000260122,0.06395362,0.0001728779,0.00001826064,7.742427e-7,0.00923293,0.000004293127,0.0001845705,0.0005397932,0.02720401,0.8983898],"study_design_scores_gemma":[0.0003390272,0.0001711575,0.8760533,0.001532013,0.0001596773,0.00006199699,0.024239,0.05758466,0.001123037,0.001274253,0.03715213,0.0003097012],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9635785,0.0001711365,0.00003875057,0.02727738,0.001843116,0.001026489,0.000001442204,0.0002034998,0.005859739],"genre_scores_gemma":[0.9904164,0.001351208,0.0002322994,0.001386869,0.001007781,0.001357606,0.0006101,0.00002220985,0.00361552],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8980801,"threshold_uncertainty_score":0.9996804,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1717367803622567,"score_gpt":0.5053216186434543,"score_spread":0.3335848382811976,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}