{"id":"W2782689587","doi":"10.1002/lary.27085","title":"Validity evidence as a key marker of quality of technical skill assessment in OTL–HNS","year":2018,"lang":"en","type":"review","venue":"The Laryngoscope","topic":"Surgical Simulation and Training","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Context (archaeology); Psychology; External validity; Quality (philosophy); Internal validity; Content validity; Quality assessment; Evidence-based practice; Medical education; Applied psychology; Psychometrics; Medicine; Clinical psychology; Social psychology; External quality assessment","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.3617699,0.001240196,0.006067555,0.02953161,0.002670407,0.01572155,0.004988829,0.004905054,0.002618864],"category_scores_gemma":[0.7492914,0.001578537,0.00901534,0.0221192,0.01082338,0.01331043,0.008804191,0.005206937,0.0003564143],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01130419,"about_ca_system_score_gemma":0.02995046,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005340621,"about_ca_topic_score_gemma":0.007488182,"domain_scores_codex":[0.4714009,0.2294962,0.1855253,0.01559664,0.09540619,0.002574763],"domain_scores_gemma":[0.09187183,0.7596902,0.083046,0.01512131,0.04885628,0.001414333],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001301234,0.0002096977,0.1524397,0.4721394,0.02456801,0.0005417535,0.0136315,0.001315353,0.0009295715,0.02019605,0.006319917,0.3064079],"study_design_scores_gemma":[0.0005694123,0.0008345356,0.1000412,0.7662065,0.03964137,0.001199929,0.008089368,0.002277094,0.002651057,0.0330248,0.04508209,0.0003825835],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.04475905,0.8708969,0.02652592,0.03558182,0.003154725,0.004241142,0.002143307,0.00008187484,0.01261526],"genre_scores_gemma":[0.7319151,0.1738314,0.07435615,0.009388326,0.001946399,0.005925306,0.001928114,0.0001131182,0.0005961863],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.3617699,"threshold_uncertainty_score":0.7870513,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2561095236087899,"score_gpt":0.5013720499627823,"score_spread":0.2452625263539924,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}