{"id":"W2034478449","doi":"10.1007/s10459-013-9458-4","title":"What counts as validity evidence? Examples and prevalence in a systematic review of simulation-based assessment","year":2013,"lang":"en","type":"review","venue":"Advances in Health Sciences Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":319,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto; University of British Columbia; University of Ottawa","funders":"","keywords":"MEDLINE; Systematic review; Evidence-based practice; Reliability (semiconductor); Evidence-based medicine; Scopus; Computer science; Process (computing); Applied psychology; Validity; Internal validity; Psychology; Data science; Psychometrics; Clinical psychology; Medicine; Alternative medicine; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1969742,0.001922599,0.01037533,0.021461,0.001775309,0.01004992,0.002834227,0.006565226,0.003494094],"category_scores_gemma":[0.6843674,0.003097773,0.00961174,0.0326955,0.0071931,0.01207711,0.005941748,0.004874231,0.0002840409],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007362699,"about_ca_system_score_gemma":0.01342599,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007034488,"about_ca_topic_score_gemma":0.0197563,"domain_scores_codex":[0.6250708,0.1796404,0.1555152,0.01008314,0.02825329,0.001437325],"domain_scores_gemma":[0.1865232,0.735159,0.0565377,0.007256425,0.01363033,0.0008934741],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.001237456,0.00004764862,0.02916116,0.8086034,0.05935057,0.000369703,0.004759508,0.0003243437,0.0003174826,0.005724147,0.00508742,0.08501714],"study_design_scores_gemma":[0.0008209039,0.0002625548,0.01666199,0.8285706,0.1231673,0.00151491,0.002564736,0.0006274639,0.0003776688,0.007858338,0.01742096,0.0001524018],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.007511314,0.9779482,0.003782327,0.006934829,0.0007014868,0.0008453722,0.0009859285,0.00002893241,0.001261684],"genre_scores_gemma":[0.2683987,0.7004253,0.01692805,0.008645525,0.0008322758,0.00326583,0.001130836,0.00009120815,0.0002823424],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.8030258,"threshold_uncertainty_score":0.9902738,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1451130859058374,"score_gpt":0.5540509874364428,"score_spread":0.4089379015306054,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}