{"id":"W4415443067","doi":"10.18296/am.0133","title":"Advancing research-based classroom assessment in a Canadian secondary school: Navigating the dilemmas","year":2025,"lang":"","type":"article","venue":"Assessment Matters","topic":"Educational Assessment and Improvement","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Dilemma; Process (computing); Relation (database); Curriculum; Best practice","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","scholarly_communication","research_integrity","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.02758808,0.0008132322,0.0009170349,0.002310748,0.002704279,0.003568397,0.003520324,0.0003129887,0.005832231],"category_scores_gemma":[0.001212356,0.0006510529,0.0003837518,0.006028139,0.0009949839,0.001499704,0.0008642286,0.006140362,0.0003502633],"about_ca_system_candidate":true,"about_ca_system_consensus":true,"about_ca_system_score_codex":0.01091307,"about_ca_system_score_gemma":0.05850248,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.2221529,"about_ca_topic_score_gemma":0.3712724,"domain_scores_codex":[0.9834517,0.003411568,0.002902662,0.002110295,0.004720152,0.00340357],"domain_scores_gemma":[0.987577,0.007082248,0.0007098578,0.002261028,0.001158718,0.001211161],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00004120703,0.0008519746,0.6201156,0.0002319059,0.0002318023,0.00007661441,0.0007105255,0.001844485,0.001543198,0.0260533,0.2606504,0.08764894],"study_design_scores_gemma":[0.002070561,0.0003074548,0.5956141,0.002124289,0.00007429346,0.000002588153,0.02917133,0.02995292,0.0001729347,0.02304805,0.3166432,0.0008182627],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.1561774,0.0007669262,0.003370165,0.7738596,0.005535661,0.003800683,0.0001348858,0.00005623282,0.05629851],"genre_scores_gemma":[0.9475551,0.00009572626,0.007136103,0.04004709,0.0002534147,0.0008977096,0.0001006009,0.00006444921,0.00384981],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7913777,"threshold_uncertainty_score":0.9995941,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05367752356955253,"score_gpt":0.4701273587498181,"score_spread":0.4164498351802656,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}