{"id":"W3011952753","doi":"10.3138/jvme.0918-116r","title":"Multiple-Choice Questions in Small Animal Medicine: An Analysis of Cognitive Level and Structural Reliability, and the Impact of these Characteristics on Student Performance","year":2020,"lang":"en","type":"article","venue":"Journal of Veterinary Medical Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Curriculum; Recall; Multiple choice; Cognition; Reliability (semiconductor); Psychology; Medical education; Medicine; Significant difference; Internal medicine; Cognitive psychology; Pedagogy","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01312232,0.0003453442,0.0003121072,0.001072046,0.0002169696,0.000635849,0.0004077229,0.00055662,0.001143593],"category_scores_gemma":[0.05642183,0.0001874538,0.0007104364,0.0008181577,0.0005511937,0.001066742,0.0007969198,0.0006632734,0.0003835257],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004373365,"about_ca_system_score_gemma":0.0004500465,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00114812,"about_ca_topic_score_gemma":0.001701512,"domain_scores_codex":[0.991896,0.004046336,0.000716095,0.0006029739,0.002415694,0.0003229716],"domain_scores_gemma":[0.9333869,0.04978393,0.00879083,0.001443733,0.005056609,0.001538062],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006011915,0.0003476998,0.9638188,0.00005939478,0.0001231103,0.00004979553,0.001530135,0.0004510257,0.001235593,0.00007462957,0.0002917063,0.03141684],"study_design_scores_gemma":[0.00002488669,0.001531563,0.9934679,0.00002485024,0.00002986879,0.0001459786,0.0005033869,0.002369486,0.001299315,0.0001116306,0.0004767194,0.00001461939],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9983358,0.0001029671,0.001014873,0.00004981365,0.000009132705,0.00004334412,0.0000495825,0.00001259967,0.0003818829],"genre_scores_gemma":[0.9984023,0.00004424944,0.001231406,0.00002353528,0.00001046767,0.00004543125,0.0001071149,0.000004848149,0.0001306361],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01312232,"threshold_uncertainty_score":0.06939828,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08613974516217211,"score_gpt":0.4433974129435004,"score_spread":0.3572576677813283,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}