{"id":"W4312094293","doi":"10.1037/spq0000527","title":"Potential scoring and predictive bias in interim and summative writing assessments.","year":2022,"lang":"en","type":"article","venue":"School Psychology","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Iowa Department of Education","keywords":"Interim; Summative assessment; Rubric; Psychology; PsycINFO; Test (biology); Scale (ratio); Mathematics education; Medical education; Formative assessment; Medicine; MEDLINE; Political science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2852567,0.001344883,0.001402476,0.006139314,0.001871435,0.002748437,0.003372707,0.001543039,0.002801016],"category_scores_gemma":[0.5593641,0.000870822,0.001710508,0.005862164,0.004393133,0.00265665,0.005088018,0.002702226,0.001076635],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002167931,"about_ca_system_score_gemma":0.002329292,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005420418,"about_ca_topic_score_gemma":0.01108387,"domain_scores_codex":[0.678556,0.1986414,0.0369999,0.02201101,0.06017374,0.003618096],"domain_scores_gemma":[0.3532206,0.4709547,0.06956897,0.06243371,0.04197489,0.001847164],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0007950877,0.000279327,0.852949,0.0008256211,0.0004874829,0.0003188805,0.01202132,0.001820962,0.0008738154,0.00934152,0.007030711,0.1132561],"study_design_scores_gemma":[0.0001442823,0.0009452731,0.8812504,0.003063603,0.0007006865,0.001493787,0.006731038,0.04214599,0.01024601,0.03154817,0.02150953,0.000221238],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7282419,0.004853709,0.2178035,0.003541142,0.001826741,0.006764705,0.003547081,0.0009097377,0.03251145],"genre_scores_gemma":[0.9077219,0.0006260084,0.0786905,0.001470424,0.0003440262,0.005128435,0.00200833,0.0002601297,0.003750256],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2852567,"threshold_uncertainty_score":0.8814058,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0793813733520772,"score_gpt":0.4492791782884478,"score_spread":0.3698978049363706,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}