{"id":"W2034478449","doi":"10.1007/s10459-013-9458-4","title":"What counts as validity evidence? Examples and prevalence in a systematic review of simulation-based assessment","year":2013,"lang":"en","type":"review","venue":"Advances in Health Sciences Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":319,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto; University of British Columbia; University of Ottawa","funders":"","keywords":"MEDLINE; Systematic review; Evidence-based practice; Reliability (semiconductor); Evidence-based medicine; Scopus; Computer science; Process (computing); Applied psychology; Validity; Internal validity; Psychology; Data science; Psychometrics; Clinical psychology; Medicine; Alternative medicine; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004633046,0.0001786802,0.001172764,0.0005040249,0.00006263885,0.00003429499,0.0002086308,0.00008870949,0.0001414764],"category_scores_gemma":[0.006331115,0.0001356941,0.00004953113,0.00163384,0.0002328944,0.0007858623,0.00001847203,0.0002546121,0.00001605332],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006599332,"about_ca_system_score_gemma":0.007335555,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007323521,"about_ca_topic_score_gemma":0.000006886929,"domain_scores_codex":[0.9966727,0.0004949673,0.001593471,0.0003968012,0.0006434898,0.0001985689],"domain_scores_gemma":[0.9961652,0.001772824,0.001341581,0.0003706999,0.0002923582,0.00005734833],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[2.950134e-7,0.00006894794,0.0001718087,0.7324391,0.000001134701,6.077288e-8,0.00004452742,0.00001598387,4.828396e-9,0.0001987101,0.00005079055,0.2670087],"study_design_scores_gemma":[0.00003800287,0.0001056726,0.00008784542,0.9545018,0.00007982743,0.000004968064,0.00018469,0.0009040049,4.946701e-8,0.000198116,0.04379845,0.00009655143],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.00002487538,0.9933728,0.0001507827,0.000693205,0.001161997,0.004440167,0.000001349316,0.000008575322,0.0001462702],"genre_scores_gemma":[0.0001789033,0.9922047,0.00502505,0.001338247,0.0000580261,0.001064302,0.00003265616,0.000008910745,0.00008924467],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.2669121,"threshold_uncertainty_score":0.9982919,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1451130859058374,"score_gpt":0.5540509874364428,"score_spread":0.4089379015306054,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}