{"id":"W3200695386","doi":"10.1097/sla.0000000000005207","title":"Validity Evidence for Procedure-specific Competence Assessment Tools in General Surgery","year":2021,"lang":"en","type":"article","venue":"Annals of Surgery","topic":"Surgical Simulation and Training","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Summative assessment; Competence (human resources); Competency assessment; Educational measurement; MEDLINE; External validity; Formative assessment","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2683508,0.001212745,0.003850925,0.02225999,0.001978283,0.01159408,0.004625126,0.003844023,0.005823978],"category_scores_gemma":[0.6649025,0.001384295,0.01106185,0.01450907,0.007801868,0.008025018,0.009272669,0.004037702,0.0006293623],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008089142,"about_ca_system_score_gemma":0.0191346,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00429368,"about_ca_topic_score_gemma":0.007477707,"domain_scores_codex":[0.6877924,0.1483981,0.0783748,0.01330225,0.06981012,0.002322321],"domain_scores_gemma":[0.134764,0.7197373,0.07569451,0.01484073,0.05342376,0.001539776],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.002011022,0.000267007,0.15511,0.3859478,0.02529417,0.0003560018,0.005103708,0.001209306,0.0007163124,0.01242794,0.004754975,0.4068017],"study_design_scores_gemma":[0.0009314791,0.001913601,0.1702742,0.7185451,0.03028265,0.001643064,0.005817751,0.001756726,0.001748819,0.01951587,0.04725134,0.0003193267],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.04129275,0.9052754,0.01375512,0.01627505,0.002520852,0.002322528,0.002094263,0.00006172086,0.01640235],"genre_scores_gemma":[0.6961538,0.2476992,0.03637059,0.009745461,0.00213181,0.003446539,0.003724913,0.0001177808,0.000610002],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2683508,"threshold_uncertainty_score":0.9022537,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.7708208277779445,"score_gpt":0.4774964002929794,"score_spread":0.2933244274849651,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}