{"id":"W4406832191","doi":"10.2196/56850","title":"Performance of ChatGPT-3.5 and ChatGPT-4 in the Taiwan National Pharmacist Licensing Examination: Comparative Evaluation Study","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Pharmacist; Pharmacy; Situational ethics; Medicine; Clinical pharmacy; Medical physics; Family medicine; Medical education; Psychology; Social psychology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01355372,0.00101823,0.001014027,0.001845258,0.0003557534,0.001270997,0.00117085,0.001227022,0.001448515],"category_scores_gemma":[0.05090927,0.0003802394,0.001541056,0.0007729491,0.0005439936,0.0017511,0.001483533,0.0007932524,0.001126393],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001294588,"about_ca_system_score_gemma":0.001091021,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005798853,"about_ca_topic_score_gemma":0.007399472,"domain_scores_codex":[0.9906415,0.004784431,0.001133979,0.00113139,0.001904874,0.0004038056],"domain_scores_gemma":[0.9503703,0.0289658,0.005151186,0.002707185,0.009619736,0.003185803],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01243762,0.005327825,0.7808769,0.0009371294,0.0006478943,0.0004957223,0.004956859,0.005851911,0.002987295,0.0002620064,0.002974283,0.1822446],"study_design_scores_gemma":[0.0004162788,0.01398688,0.9145542,0.0002006161,0.0006062901,0.0006291548,0.002112955,0.06013315,0.00428667,0.0002113003,0.002721186,0.0001411984],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9967242,0.0001919527,0.001179676,0.00006969771,0.00002771157,0.000291909,0.0003338004,0.000157202,0.001023899],"genre_scores_gemma":[0.9931855,0.0002658784,0.003770767,0.00006797421,0.00003522456,0.0003356765,0.001168195,0.00002966126,0.001141082],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01355372,"threshold_uncertainty_score":0.07167977,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1960686150432013,"score_gpt":0.5428553882530567,"score_spread":0.3467867732098553,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}