{"id":"W4386117191","doi":"10.1111/medu.15190","title":"Validity evidence supporting clinical skills assessment by artificial intelligence compared with trained clinician raters","year":2023,"lang":"en","type":"article","venue":"Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":22,"is_retracted":false,"has_abstract":true,"ca_institutions":"The Wilson Centre; University of Toronto","funders":"Novo Nordisk Fonden; Novo Nordisk","keywords":"Psychology; Educational measurement; MEDLINE; Medical education; Clinical psychology; Applied psychology; Medicine; Curriculum; Pedagogy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2835014,0.0007708538,0.001780152,0.007813087,0.001808423,0.00511728,0.002980177,0.002632859,0.002168949],"category_scores_gemma":[0.5883968,0.0007956511,0.003803649,0.005365087,0.007978637,0.003809232,0.005958693,0.002481436,0.0006239542],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003558221,"about_ca_system_score_gemma":0.004130207,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002855934,"about_ca_topic_score_gemma":0.003138659,"domain_scores_codex":[0.6584191,0.2008289,0.0415904,0.02407099,0.07199197,0.003098692],"domain_scores_gemma":[0.1144177,0.7294102,0.06490589,0.03081199,0.05780501,0.002649183],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002290879,0.0003048233,0.9142424,0.003911463,0.005240575,0.0001341408,0.007163412,0.001927533,0.0004566484,0.003250685,0.001191544,0.05988586],"study_design_scores_gemma":[0.0007261678,0.004188073,0.934008,0.008103157,0.003597019,0.0009206975,0.006968352,0.01533757,0.003404244,0.01230633,0.0101386,0.0003017643],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8954294,0.02178554,0.03780515,0.004096056,0.001477194,0.00197628,0.001459963,0.0001466904,0.0358237],"genre_scores_gemma":[0.9907002,0.0008736975,0.006647336,0.0004578928,0.0001488765,0.0004380546,0.0004498889,0.00003807074,0.0002458717],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2835014,"threshold_uncertainty_score":0.8835703,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3557575284167163,"score_gpt":0.5833110180889678,"score_spread":0.2275534896722515,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}