{"id":"W2104098335","doi":"10.1152/advan.00062.2011","title":"Are faculty predictions or item taxonomies useful for estimating the outcome of multiple-choice examinations?","year":2011,"lang":"en","type":"article","venue":"AJP Advances in Physiology Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":33,"is_retracted":false,"has_abstract":true,"ca_institutions":"Health Sciences Centre; Memorial University of Newfoundland","funders":"","keywords":"Multiple choice; Comprehension; Psychology; Cronbach's alpha; Cognition; Correlation; Reliability (semiconductor); Cognitive psychology; Applied psychology; Clinical psychology; Psychometrics; Statistics; Significant difference; Computer science; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02379354,0.0009489621,0.0009324525,0.003444907,0.0004446162,0.002019706,0.000683646,0.001057131,0.001334563],"category_scores_gemma":[0.1865131,0.0004792287,0.0006947801,0.002357703,0.0008499253,0.003535814,0.001115946,0.0009301672,0.001007551],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000464852,"about_ca_system_score_gemma":0.0006394918,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001346864,"about_ca_topic_score_gemma":0.002457249,"domain_scores_codex":[0.9877546,0.007330581,0.001004303,0.001172244,0.002349306,0.0003889514],"domain_scores_gemma":[0.776386,0.1621116,0.03284813,0.0155993,0.009992965,0.003061912],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001800262,0.00007520699,0.9617444,0.00003154549,0.00007407922,0.00002825746,0.0003351616,0.00087737,0.0003826851,0.000106432,0.0002304905,0.03593442],"study_design_scores_gemma":[0.00002684909,0.0005195942,0.979723,0.00006087149,0.00005476123,0.0001333329,0.0006441342,0.01572998,0.0009745979,0.00141234,0.0006873672,0.00003328707],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9760202,0.0003131669,0.02075092,0.0001812151,0.00004369492,0.00009326288,0.0004378999,0.0001685662,0.001991017],"genre_scores_gemma":[0.9913085,0.00008928419,0.007763032,0.00003370731,0.0000352112,0.00008799658,0.0004696972,0.00002595811,0.0001866124],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9762065,"threshold_uncertainty_score":0.1258338,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.107425240291903,"score_gpt":0.4081473811044154,"score_spread":0.3007221408125125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}