{"id":"W4401079394","doi":"10.1186/s12909-024-05803-6","title":"Measuring and correcting staff variability in large-scale OSCEs","year":2024,"lang":"en","type":"article","venue":"BMC Medical Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hotel Dieu Hospital","funders":"","keywords":"Grading (engineering); Session (web analytics); Confidence interval; Medical education; Psychology; Grading scale; Variance (accounting); Consistency (knowledge bases); Scale (ratio); Statistics; Medicine; Computer science; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1237489,0.001072737,0.0008450663,0.002052751,0.001067342,0.001807355,0.001789803,0.001065251,0.001025707],"category_scores_gemma":[0.3265373,0.0006502167,0.001370851,0.00240601,0.001052653,0.001468518,0.003139253,0.001035162,0.0005349062],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001623782,"about_ca_system_score_gemma":0.003071995,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003018743,"about_ca_topic_score_gemma":0.00567186,"domain_scores_codex":[0.871878,0.08625998,0.01236352,0.009780006,0.01851522,0.001203283],"domain_scores_gemma":[0.5988745,0.2509578,0.07724612,0.03845202,0.0328375,0.001632054],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0007207601,0.0002893534,0.7065051,0.001154255,0.001623048,0.0001676566,0.006606461,0.009475872,0.004916489,0.002103665,0.004711471,0.2617259],"study_design_scores_gemma":[0.0001155174,0.001765851,0.9276242,0.0008496582,0.0009671338,0.0004712189,0.002438515,0.03711082,0.01465314,0.004284219,0.009532769,0.0001868641],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4970835,0.001505309,0.4934406,0.001105212,0.0005646124,0.001208901,0.0009010512,0.0009939265,0.00319702],"genre_scores_gemma":[0.8801937,0.0002827907,0.1157333,0.000338339,0.0002321417,0.001346765,0.0008200989,0.0002609074,0.0007920564],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1237489,"threshold_uncertainty_score":0.6544546,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02410916767005815,"score_gpt":0.3447051655968144,"score_spread":0.3205959979267562,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}