{"id":"W2067223870","doi":"10.1007/bf03019750","title":"Validity and reliability of undergraduate performance assessments in an anesthesia simulator","year":2001,"lang":"en","type":"article","venue":"Canadian Journal of Anesthesia/Journal canadien d anesthésie","topic":"Simulation-Based Education in Healthcare","field":"Medicine","cited_by":60,"is_retracted":false,"has_abstract":false,"ca_institutions":"Health Sciences Centre; University of Toronto; Sunnybrook Health Science Centre","funders":"University of Toronto; Canadian Anesthesiologists' Society","keywords":"Checklist; Reliability (semiconductor); Repeatability; Simulation; Psychology; Protocol (science); Consistency (knowledge bases); Computer science; Medical physics; Medicine; Statistics; Mathematics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002011562,0.0003159574,0.0007865672,0.001146064,0.0002857035,0.00009305451,0.0003273688,0.0002450843,0.0001182189],"category_scores_gemma":[0.0002132527,0.0002976686,0.0001506457,0.0007467786,0.0002779289,0.0007618914,0.000004542843,0.0009029724,0.00000285346],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00147876,"about_ca_system_score_gemma":0.008968504,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009084472,"about_ca_topic_score_gemma":0.004921381,"domain_scores_codex":[0.9965873,0.0003526515,0.001405688,0.0002951556,0.0006195638,0.0007396352],"domain_scores_gemma":[0.9939122,0.0002348283,0.0008624101,0.0004156126,0.001710393,0.002864616],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002799725,0.00009078205,0.9307906,0.0001338616,0.00001323435,0.06316897,0.0009984144,0.003537107,0.000008594941,0.00003841818,0.0001155164,0.000824517],"study_design_scores_gemma":[0.0009671225,0.001441542,0.5534502,0.0003111257,0.00006487268,0.4408955,0.000660191,0.001199316,0.00002531344,0.0002897323,0.0005200707,0.0001750198],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9893366,0.0002459727,0.000009167788,0.00989066,0.0001643396,0.0002879192,0.000001949204,0.000007474883,0.00005591739],"genre_scores_gemma":[0.9985348,0.0001227825,0.0006484995,0.0002015554,0.0003432448,0.00000297731,0.000008618165,0.00004965172,0.00008788989],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3777265,"threshold_uncertainty_score":0.9999475,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03342188791124928,"score_gpt":0.3141108664119323,"score_spread":0.280688978500683,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}