{"id":"W2237048265","doi":"10.3138/jvme.0715-112r","title":"Rater Errors in Clinical Performance Assessments","year":2015,"lang":"en","type":"article","venue":"Journal of Veterinary Medical Education","topic":"Veterinary Practice and Education Studies","field":"Health Professions","cited_by":31,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Variety (cybernetics); Medical education; Psychology; Educational measurement; Medicine; Applied psychology; Computer science; Pedagogy; Curriculum; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.4255416,0.001516635,0.002285579,0.006638722,0.002425986,0.004053793,0.003745732,0.001672327,0.001492084],"category_scores_gemma":[0.6929721,0.001016819,0.001611272,0.00603533,0.003900417,0.004015231,0.005531176,0.003765417,0.001326351],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003763271,"about_ca_system_score_gemma":0.004049475,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003503467,"about_ca_topic_score_gemma":0.004544877,"domain_scores_codex":[0.2948103,0.428709,0.1058301,0.02052478,0.148179,0.001946621],"domain_scores_gemma":[0.170316,0.5347443,0.09501015,0.06097845,0.1370813,0.001869817],"domain_codex":"methods","domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.003210275,0.000687882,0.1971589,0.008712523,0.002916133,0.001587357,0.07277099,0.006550211,0.0108799,0.02261502,0.04626769,0.6266431],"study_design_scores_gemma":[0.0008124008,0.005753096,0.4100361,0.02292364,0.002713409,0.0100808,0.02854175,0.0515535,0.0700436,0.07648291,0.3192931,0.001765647],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2090963,0.02252243,0.6823945,0.01000362,0.008754475,0.01442432,0.002832799,0.002875844,0.04709576],"genre_scores_gemma":[0.6720791,0.00479675,0.2942258,0.005518905,0.002294071,0.01096728,0.001272503,0.001168475,0.007677034],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.4255416,"threshold_uncertainty_score":0.7084095,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6976178473303414,"score_gpt":0.6687145864045766,"score_spread":0.02890326092576478,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}