{"id":"W7161558043","doi":"10.1093/postmj/qgaf195","title":"Artificial intelligence for assessment in competency-based medical education: current practices and future directions","year":2025,"lang":"en","type":"article","venue":"Postgraduate Medical Journal","topic":"Innovations in Medical Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University; University of British Columbia","funders":"","keywords":"Software deployment; Scopus; Narrative review; Inclusion (mineral); MEDLINE; Educational measurement; Applications of artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1071684,0.001308535,0.00399765,0.01294881,0.00157612,0.01307518,0.004276237,0.004903137,0.005043404],"category_scores_gemma":[0.1425314,0.001012811,0.003245891,0.01545574,0.009494682,0.01682551,0.00744648,0.006487344,0.001084749],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01004283,"about_ca_system_score_gemma":0.0349575,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008672238,"about_ca_topic_score_gemma":0.01119907,"domain_scores_codex":[0.9371483,0.04112034,0.009693454,0.002971659,0.008117608,0.0009486005],"domain_scores_gemma":[0.5838397,0.3782084,0.01077594,0.006384493,0.0187117,0.002079826],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001227259,0.00009695985,0.001713866,0.1361278,0.000371994,0.00009862868,0.002602553,0.0004969937,0.0001883497,0.02877842,0.008377939,0.8210237],"study_design_scores_gemma":[0.00007440725,0.0002329912,0.005808894,0.6977807,0.000809298,0.0004888314,0.005938604,0.001251156,0.0004122137,0.0687331,0.2183134,0.0001565024],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0004498322,0.9769036,0.002717399,0.01667309,0.0005450468,0.00008346754,0.00003334599,0.00003367213,0.002560439],"genre_scores_gemma":[0.01793998,0.9547983,0.0198223,0.005867041,0.0007688748,0.0004825263,0.00007690163,0.00002968392,0.0002144349],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.1071684,"threshold_uncertainty_score":0.5667673,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04904060000455475,"score_gpt":0.4628714152828736,"score_spread":0.4138308152783189,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}