{"id":"W2104098335","doi":"10.1152/advan.00062.2011","title":"Are faculty predictions or item taxonomies useful for estimating the outcome of multiple-choice examinations?","year":2011,"lang":"en","type":"article","venue":"AJP Advances in Physiology Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":33,"is_retracted":false,"has_abstract":true,"ca_institutions":"Health Sciences Centre; Memorial University of Newfoundland","funders":"","keywords":"Multiple choice; Comprehension; Psychology; Cronbach's alpha; Cognition; Correlation; Reliability (semiconductor); Cognitive psychology; Applied psychology; Clinical psychology; Psychometrics; Statistics; Significant difference; Computer science; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0002940395,0.0001371324,0.0002694946,0.0002073479,0.0001636351,0.000004313961,0.0001709976,0.0001053023,0.00006768916],"category_scores_gemma":[0.01354025,0.00009589858,0.00005310214,0.0005070054,0.0002844201,0.0003295686,0.0000263821,0.000215334,0.000005049297],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001497169,"about_ca_system_score_gemma":0.0002089754,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00006377195,"about_ca_topic_score_gemma":0.0001372573,"domain_scores_codex":[0.9987519,0.00005782072,0.0006150955,0.0002686168,0.0001152879,0.0001912758],"domain_scores_gemma":[0.9975105,0.001014714,0.0006107668,0.000368813,0.0004706362,0.0000245769],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001736432,0.001309845,0.9323834,0.0005403775,0.00004408818,1.384693e-7,0.002672505,0.0003481668,0.0006044342,0.001336098,0.002832161,0.05775519],"study_design_scores_gemma":[0.0005785979,0.0001295536,0.978485,0.0001823667,0.00005675424,0.000006928518,0.005296039,0.005454676,0.0004740866,0.001322242,0.007914215,0.0000995018],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.987487,0.0002007322,0.007222805,0.0009107108,0.002382021,0.00125208,0.00002570125,0.00004615871,0.000472806],"genre_scores_gemma":[0.9254044,0.0000221504,0.07158841,0.0006922535,0.000406057,0.001378272,0.0002009551,0.00001604649,0.0002914129],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06436561,"threshold_uncertainty_score":0.9947691,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.107425240291903,"score_gpt":0.4081473811044154,"score_spread":0.3007221408125125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}