{"id":"W4414203932","doi":"10.1145/3767736","title":"Can Alternative Grading Improve Student Interactions in Automatically Graded Programming Assignments?","year":2025,"lang":"en","type":"article","venue":"ACM Transactions on Computing Education","topic":"Teaching and Learning Programming","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Grading (engineering); Debugging; Oracle; Formative assessment; Suite; Test suite; Unit testing; Software; Summative assessment; Software development","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02177206,0.0009406126,0.001010399,0.001912357,0.001355284,0.005313876,0.002104851,0.001218105,0.007571399],"category_scores_gemma":[0.1442181,0.0004581,0.0008149209,0.001389629,0.0009957207,0.004103899,0.003188089,0.001731457,0.003167549],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001651359,"about_ca_system_score_gemma":0.002330904,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001030433,"about_ca_topic_score_gemma":0.002742474,"domain_scores_codex":[0.9629877,0.02197587,0.002043801,0.004580942,0.006611145,0.001800457],"domain_scores_gemma":[0.8836187,0.06333866,0.01638908,0.01071923,0.01722693,0.008707386],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.001616542,0.007593193,0.1539004,0.0009467927,0.0001133643,0.0001902358,0.01869926,0.002480109,0.009315768,0.001376414,0.01200386,0.7917641],"study_design_scores_gemma":[0.002054451,0.02898818,0.6885221,0.002124074,0.0006536418,0.0007452249,0.03816488,0.0606766,0.03843043,0.02240556,0.1159369,0.001297939],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9501595,0.0002175279,0.03287076,0.002031743,0.0003560293,0.001101169,0.0002189091,0.001715234,0.011329],"genre_scores_gemma":[0.9539964,0.0001343784,0.04127567,0.0004970316,0.00007932353,0.001146208,0.0002185648,0.0001433394,0.002509063],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02177206,"threshold_uncertainty_score":0.1151431,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01910403271611229,"score_gpt":0.3473919119798712,"score_spread":0.328287879263759,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}