{"id":"W7128677453","doi":"10.1145/3760545.3783964","title":"Two-Stage CS Exams: A Multi-Institutional Study of Course and Exam Feature Impacts on Student Perceptions and Performance","year":2025,"lang":"","type":"article","venue":"","topic":"Teaching and Learning Programming","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Lethbridge; University of Manitoba","funders":"","keywords":"Perception; Variety (cybernetics); Qualitative analysis; Qualitative property; Raw score","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001122298,0.000379697,0.0004089569,0.0002740841,0.001152806,0.000502182,0.000468831,0.0001173195,0.00001840903],"category_scores_gemma":[0.00008467097,0.0003076006,0.00005904582,0.0004851889,0.0003159489,0.0004510591,0.0005688947,0.0008846833,0.00000504209],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008795592,"about_ca_system_score_gemma":0.000257786,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003750202,"about_ca_topic_score_gemma":0.0002906788,"domain_scores_codex":[0.9975008,0.0003531394,0.0003834679,0.0008090149,0.000517061,0.0004365062],"domain_scores_gemma":[0.9987453,0.0001900289,0.0001638375,0.0005833003,0.0001134671,0.0002040712],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00006465122,0.005140057,0.5720732,0.0001821573,0.0002239506,0.00002217825,0.05606473,0.004661394,0.00007220858,0.003186218,0.00007594276,0.3582333],"study_design_scores_gemma":[0.003298887,0.002151646,0.9238406,0.0004301747,0.0001062242,0.00001792472,0.01529124,0.05350837,0.00001028518,0.00000101529,0.001061276,0.0002823651],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9754238,0.0008777605,0.02159817,0.0003926162,0.0004289414,0.0007497591,0.00000436774,0.0001121027,0.0004124733],"genre_scores_gemma":[0.9856577,0.000152904,0.009587747,0.000148019,0.00004493555,0.00002209729,0.000001976488,0.000009561315,0.004375053],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3579509,"threshold_uncertainty_score":0.9999376,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0263403532693171,"score_gpt":0.3397722019296996,"score_spread":0.3134318486603825,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}