{"id":"W2176361635","doi":"10.3402/meo.v20.29242","title":"Probing the effect of OSCE checklist length on inter-observer reliability and observer accuracy","year":2015,"lang":"en","type":"article","venue":"Medical Education Online","topic":"Innovations in Medical Education","field":"Medicine","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Checklist; Intraclass correlation; Objective structured clinical examination; Reliability (semiconductor); Medicine; Grading (engineering); Consistency (knowledge bases); Psychology; Medical education; Clinical psychology; Psychometrics; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1713258,0.0007117447,0.0008661053,0.001669992,0.0008326383,0.001546926,0.001146633,0.0008973039,0.001075641],"category_scores_gemma":[0.4224235,0.0007200049,0.001550697,0.00142418,0.002106425,0.001768542,0.002046628,0.001182116,0.000446971],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00152871,"about_ca_system_score_gemma":0.0008768694,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001256611,"about_ca_topic_score_gemma":0.001902936,"domain_scores_codex":[0.7166991,0.1953468,0.03290917,0.01449526,0.03846161,0.002088028],"domain_scores_gemma":[0.2750046,0.6233152,0.04417969,0.02624235,0.03016096,0.001097173],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004522473,0.000372051,0.8776383,0.001019281,0.001769725,0.0001672823,0.009730925,0.003427833,0.007276191,0.0008432544,0.001484158,0.09174848],"study_design_scores_gemma":[0.0001879085,0.005179574,0.9602761,0.000504114,0.0007255089,0.0007380135,0.001674647,0.01573774,0.01086705,0.001178812,0.002778897,0.0001516318],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.893737,0.003188723,0.09417,0.0005909851,0.0004238934,0.00127395,0.0004510866,0.0002821742,0.005882218],"genre_scores_gemma":[0.9842997,0.0001553898,0.0137877,0.0001775445,0.00007874028,0.0008699403,0.0001791571,0.0001012289,0.0003506985],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8286743,"threshold_uncertainty_score":0.906068,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02761102858187187,"score_gpt":0.374156929602999,"score_spread":0.3465459010211271,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}