{"id":"W4417402931","doi":"10.1371/journal.pone.0337688","title":"Diagnostic performance of four AI tools in pharmacology MCQs: Accuracy, sensitivity, and specificity","year":2025,"lang":"en","type":"article","venue":"PLoS ONE","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa","funders":"","keywords":"Clinical pharmacology; Safety pharmacology; Reproducibility; MEDLINE; Value (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0391601,0.001336492,0.001319447,0.007127422,0.0004818343,0.003133292,0.001678126,0.001996961,0.003107875],"category_scores_gemma":[0.1583932,0.0003606098,0.00278214,0.002669486,0.001202352,0.00270444,0.003662621,0.001345312,0.001458026],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001413553,"about_ca_system_score_gemma":0.001282922,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001439115,"about_ca_topic_score_gemma":0.001795217,"domain_scores_codex":[0.9524993,0.02177667,0.007419975,0.003492497,0.01322538,0.001586179],"domain_scores_gemma":[0.7784117,0.1656464,0.02503741,0.007086044,0.02136749,0.002451022],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004707518,0.0006572372,0.7652233,0.002676766,0.001150011,0.0003499722,0.002907543,0.003428414,0.00323343,0.001498904,0.00768176,0.2064851],"study_design_scores_gemma":[0.000665953,0.003505615,0.87462,0.002650758,0.002182827,0.003757789,0.003306255,0.05700992,0.0205207,0.006796936,0.0245861,0.000397156],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9347606,0.008025223,0.02900992,0.001891049,0.0004149284,0.002135465,0.004915806,0.001968696,0.01687828],"genre_scores_gemma":[0.959704,0.00109114,0.03454478,0.0004328398,0.0001249487,0.0009839004,0.002173831,0.0001013352,0.0008431612],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0391601,"threshold_uncertainty_score":0.2071008,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2458673246004676,"score_gpt":0.4118791763509185,"score_spread":0.1660118517504509,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}