{"id":"W1121875846","doi":"10.1016/j.jsurg.2015.04.029","title":"The Generic Error Rating Tool: A Novel Approach to Assessment of Performance and Surgical Education in Gynecologic Laparoscopy","year":2015,"lang":"en","type":"article","venue":"Journal of surgical education","topic":"Surgical Simulation and Training","field":"Medicine","cited_by":44,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto; St. Michael's Hospital","funders":"","keywords":"Inter-rater reliability; Intraclass correlation; Laparoscopy; Medicine; Interquartile range; Intra-rater reliability; Reliability (semiconductor); Rating scale; Surgery; Medical physics; Psychometrics; Statistics; Mathematics; Confidence interval; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01450402,0.0007949084,0.001150487,0.004217142,0.0005565847,0.00198862,0.001387881,0.001161714,0.002423888],"category_scores_gemma":[0.06558549,0.0003202717,0.002087572,0.002167758,0.0005963563,0.002694245,0.002990826,0.0012097,0.0006265703],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009401884,"about_ca_system_score_gemma":0.001603319,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001397578,"about_ca_topic_score_gemma":0.003465529,"domain_scores_codex":[0.980353,0.00763832,0.003358906,0.00114988,0.007071534,0.0004284578],"domain_scores_gemma":[0.9513484,0.02733785,0.007880447,0.002230322,0.01009587,0.00110713],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001309649,0.0008313925,0.6066272,0.0009255792,0.0009965689,0.0002589842,0.002596776,0.004310163,0.004636311,0.004242475,0.008160694,0.3651042],"study_design_scores_gemma":[0.0003261932,0.00373656,0.9147049,0.0005973089,0.0006467688,0.002162788,0.003885084,0.04929686,0.004553241,0.00601735,0.01366368,0.0004094307],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.665637,0.001709681,0.2980302,0.001491929,0.0009944094,0.002882986,0.003799914,0.001309807,0.02414413],"genre_scores_gemma":[0.8281645,0.0005181594,0.1655399,0.0003666221,0.0002295453,0.001846192,0.001089849,0.000158436,0.002086892],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01450402,"threshold_uncertainty_score":0.07670557,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.070803474136236,"score_gpt":0.3849640659900897,"score_spread":0.3141605918538537,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}