{"id":"W3136573347","doi":"10.1177/21582440211016838","title":"A Baseline for Multiple-Choice Testing in the University Classroom","year":2021,"lang":"en","type":"preprint","venue":"SAGE Open","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Trent University","funders":"","keywords":"Baseline (sea); Reliability (semiconductor); Context (archaeology); Test (biology); Multiple choice; Variety (cybernetics); Psychometrics; Item response theory; Psychology; Quality (philosophy); Applied psychology; Standardized test; Computer science; Medical education; Mathematics education; Statistics; Clinical psychology; Artificial intelligence; Medicine; Significant difference","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002477158,0.0001216465,0.0002144118,0.00004261333,0.0005099426,0.0005678641,0.00186898,0.000154159,0.0001583808],"category_scores_gemma":[0.002805929,0.0001093168,0.00008517061,0.0003347148,0.00007289059,0.0001915155,0.001404982,0.0003538019,0.000006222826],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001696511,"about_ca_system_score_gemma":0.0005379546,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.02144524,"about_ca_topic_score_gemma":0.1096147,"domain_scores_codex":[0.9983835,0.000563333,0.0001479799,0.0003646023,0.0002766321,0.000263958],"domain_scores_gemma":[0.9957234,0.0037256,0.0001239093,0.0002800379,0.0001050185,0.00004198495],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00006507572,0.0003423315,0.9005555,0.00009560563,0.00008378552,0.00008365574,0.06091639,0.0001256449,0.00006040515,0.001112951,0.006696206,0.02986245],"study_design_scores_gemma":[0.002557785,0.00004582934,0.3710041,0.0007065193,0.0001370545,3.885871e-7,0.233679,0.002323899,0.000005906419,0.0009585191,0.387911,0.0006700217],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4928439,0.0006374097,0.005148543,0.01673422,0.002227171,0.01262656,0.0002176768,0.0001447663,0.4694197],"genre_scores_gemma":[0.9798705,0.00009597121,0.01062343,0.0004142696,0.0005209612,0.00005881592,0.0001025312,0.00001459939,0.008298899],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5295514,"threshold_uncertainty_score":0.9850711,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1240605135399276,"score_gpt":0.3860146464138089,"score_spread":0.2619541328738814,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}