{"id":"W2566941704","doi":"10.1007/s40037-016-0322-0","title":"Ensuring the quality of multiple-choice exams administered to small cohorts: A&amp;nbsp;cautionary tale","year":2017,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Université de Sherbrooke; McGill University Health Centre","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Medical education; Quality (philosophy); Medicine; Medical physics; Data science; Computer science","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1099715,0.0007159628,0.0009649005,0.002421445,0.002040023,0.002962039,0.003140887,0.001777394,0.003529922],"category_scores_gemma":[0.2983675,0.0006506711,0.0007370303,0.002201397,0.002876197,0.002793569,0.003002999,0.002784474,0.002392217],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001894587,"about_ca_system_score_gemma":0.006612881,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006585085,"about_ca_topic_score_gemma":0.01137973,"domain_scores_codex":[0.932084,0.03008276,0.01072985,0.003724643,0.02229746,0.001081216],"domain_scores_gemma":[0.6545119,0.176202,0.05562577,0.02692253,0.07858976,0.008148134],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005420142,0.000516589,0.4865459,0.002806504,0.0002553342,0.0007117386,0.0181695,0.0007366937,0.007577336,0.003093041,0.08020671,0.3988385],"study_design_scores_gemma":[0.00008188608,0.0009772655,0.8920217,0.003299213,0.0001033165,0.001541704,0.005564883,0.003711245,0.009450476,0.005194117,0.07786008,0.0001942293],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.7843369,0.005761529,0.1149681,0.05205422,0.002679208,0.003731856,0.00228477,0.00169331,0.03249],"genre_scores_gemma":[0.8441125,0.002262881,0.1359487,0.007108159,0.0007824409,0.003504475,0.0008740542,0.0002630168,0.00514369],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.1099715,"threshold_uncertainty_score":0.5815917,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5824138672067543,"score_gpt":0.5656129978868703,"score_spread":0.016800869319884,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}