{"id":"W3136573347","doi":"10.1177/21582440211016838","title":"A Baseline for Multiple-Choice Testing in the University Classroom","year":2021,"lang":"en","type":"preprint","venue":"SAGE Open","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Trent University","funders":"","keywords":"Baseline (sea); Reliability (semiconductor); Context (archaeology); Test (biology); Multiple choice; Variety (cybernetics); Psychometrics; Item response theory; Psychology; Quality (philosophy); Applied psychology; Standardized test; Computer science; Medical education; Mathematics education; Statistics; Clinical psychology; Artificial intelligence; Medicine; Significant difference","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05853933,0.0006210666,0.001063728,0.004445956,0.00372662,0.005899357,0.002464111,0.001617695,0.005977901],"category_scores_gemma":[0.2417131,0.0003998059,0.0007035902,0.004393367,0.003715457,0.005083021,0.003695474,0.004092114,0.002182196],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.006893489,"about_ca_system_score_gemma":0.009742243,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01442381,"about_ca_topic_score_gemma":0.01527942,"domain_scores_codex":[0.9386607,0.02785555,0.005054038,0.005324788,0.02147388,0.001631082],"domain_scores_gemma":[0.7833449,0.07176012,0.009295452,0.03401349,0.09491345,0.006672698],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.001058503,0.002137603,0.1434274,0.001103011,0.00009979631,0.0003623821,0.0378759,0.002334345,0.01593984,0.1179983,0.03041451,0.6472485],"study_design_scores_gemma":[0.0002877666,0.003994773,0.5261893,0.002858777,0.00009661419,0.000910323,0.02753426,0.01026817,0.02367661,0.1163163,0.287533,0.0003340809],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.4346073,0.001885595,0.445589,0.01247382,0.001327765,0.003558065,0.004673991,0.002173988,0.09371057],"genre_scores_gemma":[0.72343,0.0003202887,0.2612199,0.001690276,0.000298481,0.00490554,0.002969822,0.0005859556,0.004579721],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.05853933,"threshold_uncertainty_score":0.3095893,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1240605135399276,"score_gpt":0.3860146464138089,"score_spread":0.2619541328738814,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}