{"id":"W4220985017","doi":"10.1111/vsu.13791","title":"Evaluating validity evidence for 2 instruments developed to assess students' surgical skills in a simulated environment","year":2022,"lang":"en","type":"article","venue":"Veterinary Surgery","topic":"Veterinary Practice and Education Studies","field":"Health Professions","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Prince Edward Island","funders":"","keywords":"Checklist; Content validity; Generalizability theory; Medicine; Reliability (semiconductor); Psychometrics; Clinical psychology; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.006911423,0.0002350917,0.000501576,0.0003058964,0.001425454,0.00002336471,0.0003139219,0.00007247204,0.001388533],"category_scores_gemma":[0.001646798,0.0002488592,0.0001133664,0.0004600006,0.00003341021,0.0003811835,0.001327353,0.0004722074,0.0001839835],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008643663,"about_ca_system_score_gemma":0.0004698496,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000140787,"about_ca_topic_score_gemma":0.000003559455,"domain_scores_codex":[0.9942318,0.002709774,0.0009944838,0.00058676,0.0007588054,0.0007183267],"domain_scores_gemma":[0.9889399,0.0100957,0.0003333539,0.0003936469,0.00007663874,0.0001607822],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003056372,0.001318954,0.9693466,0.0003249928,0.00009906291,0.0002658902,0.007484729,0.001602816,0.001124296,0.00000693043,0.004066496,0.01130283],"study_design_scores_gemma":[0.001995559,0.002415572,0.6645998,0.0005857259,0.00005676745,0.00009608044,0.01218981,0.0004318097,0.00002139039,0.00005690794,0.316806,0.0007444966],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9944487,0.00008805952,0.00005449481,0.001436009,0.002011067,0.001790615,0.00003816624,0.00005982781,0.0000730379],"genre_scores_gemma":[0.9932187,0.0001395142,0.001176475,0.0009503833,0.0001542558,0.002959215,0.00005018376,0.00003760694,0.001313667],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3127395,"threshold_uncertainty_score":0.9999964,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8262828402652543,"score_gpt":0.6291034980016528,"score_spread":0.1971793422636016,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}