{"id":"W2207150368","doi":"10.1016/j.jsurg.2015.04.020","title":"Reliable Assessment of Performance in Surgery: A Practical Approach to Generalizability Theory","year":2015,"lang":"en","type":"editorial","venue":"Journal of surgical education","topic":"Surgical Simulation and Training","field":"Medicine","cited_by":8,"is_retracted":false,"has_abstract":false,"ca_institutions":"McGill University","funders":"","keywords":"Generalizability theory; Debriefing; Preparedness; Thematic analysis; Medical education; Perioperative; Medicine; Psychology; Qualitative research; Surgery","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007291475,0.0001949952,0.00105412,0.0004515555,0.00002303661,0.00002288344,0.00009954968,0.000464534,0.0001502055],"category_scores_gemma":[0.003866609,0.0001466561,0.0002530876,0.0005322122,0.00006109238,0.0001835685,0.0000310763,0.001171546,0.000003497787],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005845163,"about_ca_system_score_gemma":0.008391382,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001766657,"about_ca_topic_score_gemma":5.387261e-7,"domain_scores_codex":[0.9963814,0.0003642988,0.001345495,0.000238964,0.001449506,0.000220336],"domain_scores_gemma":[0.9944055,0.002390452,0.0008127624,0.0002453683,0.001726685,0.0004191975],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.004096787,0.006991865,0.02504186,0.0009472406,0.0001649526,0.00005080617,0.0005130414,0.001666529,0.000005026809,0.00140077,0.9402363,0.01888485],"study_design_scores_gemma":[0.00178475,0.0002994056,0.006872579,0.000576361,0.0001165613,0.00007925823,0.0002139649,0.0004485321,0.000007714219,0.0001818349,0.9892743,0.0001446923],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"editorial","genre_gemma":"empirical","genre_scores_codex":[0.2803214,0.0008018988,0.0006554173,0.0021548,0.6493322,0.0009737508,0.0000157227,0.00002609993,0.06571872],"genre_scores_gemma":[0.6760653,0.0005434325,0.007746675,0.0001128282,0.3144647,0.00002877533,0.0001994571,0.00004759478,0.0007913343],"genre_candidate":"editorial","genre_consensus":null,"teacher_disagreement_score":0.3957439,"threshold_uncertainty_score":0.9972301,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05541464794960498,"score_gpt":0.4063985187289122,"score_spread":0.3509838707793072,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}