{"id":"W2049871613","doi":"10.1007/bf03016408","title":"Expert versus non-expert raters in simulation performance evaluation","year":2008,"lang":"en","type":"article","venue":"Canadian Journal of Anesthesia/Journal canadien d anesthésie","topic":"Simulation Techniques and Applications","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"The Wilson Centre; University of Toronto; Women's College Hospital","funders":"","keywords":"Computer science; Psychology; Artificial intelligence; Natural language processing; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1001684,0.0005568709,0.001103443,0.001324824,0.0005255322,0.001464865,0.0008653475,0.001045541,0.002377391],"category_scores_gemma":[0.288572,0.0004867745,0.0008476041,0.0006632496,0.0006669146,0.002225494,0.001328364,0.001394756,0.0006493277],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001006131,"about_ca_system_score_gemma":0.001279047,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001887492,"about_ca_topic_score_gemma":0.003280029,"domain_scores_codex":[0.9025401,0.07932461,0.006065004,0.002261013,0.008413929,0.001395265],"domain_scores_gemma":[0.5677349,0.3833833,0.01164824,0.008736572,0.0223298,0.006167147],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.114948,0.00517881,0.4588612,0.00134391,0.002377153,0.0003646077,0.01246415,0.02659146,0.004098343,0.002704927,0.004833495,0.3662339],"study_design_scores_gemma":[0.005326036,0.04487421,0.6658854,0.001389633,0.002228559,0.001518912,0.009872172,0.2456707,0.01080686,0.005155298,0.006658212,0.0006138605],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9833533,0.001448149,0.01061332,0.0002108786,0.000179459,0.0003971454,0.0001118516,0.00006599836,0.003620075],"genre_scores_gemma":[0.9936448,0.0002555287,0.005136355,0.00009321653,0.00004277567,0.0001924892,0.0001085291,0.00002916066,0.0004971178],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1001684,"threshold_uncertainty_score":0.5297477,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0959764257871998,"score_gpt":0.3544521935698364,"score_spread":0.2584757677826366,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}