{"id":"W4407557145","doi":"","title":"Comparative judgement and its impact on the quality of students' written work in mathematics","year":2024,"lang":"en","type":"article","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Educational Assessment and Pedagogy","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Okanagan University College; University of British Columbia, Okanagan Campus; University of British Columbia","funders":"","keywords":"Judgement; Work (physics); Quality (philosophy); Mathematics education; Computer science; Mathematics; Engineering; Epistemology; Mechanical engineering; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008201963,0.00008888807,0.0001575735,0.0000772104,0.0002002712,0.0001901361,0.0004098086,0.00004126976,0.0002644761],"category_scores_gemma":[0.0004040101,0.00006457815,0.00005576164,0.0004650054,0.0001601302,0.0000972816,0.0001020057,0.0001470361,0.00002317164],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008874698,"about_ca_system_score_gemma":0.0001881009,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001257142,"about_ca_topic_score_gemma":0.003434162,"domain_scores_codex":[0.9959488,0.003007078,0.0002738801,0.0001789021,0.0004435597,0.0001478157],"domain_scores_gemma":[0.9948738,0.00431258,0.0001120823,0.0002674185,0.0003763018,0.00005779984],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"observational","study_design_scores_codex":[0.000007655329,0.0004659906,0.02705812,0.00003380548,0.00004173323,3.124321e-7,0.1477301,0.000005103896,0.0001561929,0.8225517,0.0008225039,0.001126753],"study_design_scores_gemma":[0.0008082466,0.000003439377,0.8706794,0.002951382,0.0000555318,8.817237e-7,0.0517457,0.00229105,0.005238859,0.04318782,0.02246919,0.0005684504],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9346099,0.0005908994,0.0002472302,0.01741146,0.00006541301,0.000283402,0.00001036598,0.00002661441,0.04675466],"genre_scores_gemma":[0.9937241,0.0002005121,0.0005722036,0.00004151527,0.00001363194,0.00002624033,0.00001243421,0.000005359573,0.005403978],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.8436213,"threshold_uncertainty_score":0.2895827,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08000636061367551,"score_gpt":0.4273242405371565,"score_spread":0.347317879923481,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}