{"id":"W2885719062","doi":"","title":"Collaboration Between Content Experts and Assessment Specialists: Using a Validity Argument Framework to Develop a College Mathematics Assessment","year":2018,"lang":"en","type":"article","venue":"Canadian Journal of Education / Revue canadienne de l éducation","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University; Institute for Christian Studies; University of Toronto","funders":"","keywords":"Argument (complex analysis); Content validity; Psychology; Educational assessment; Content (measure theory); Mathematics education; Psychometrics; Medicine; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00233204,0.0001790934,0.0003140648,0.0005553262,0.0009080135,0.0003928004,0.0003090978,0.0001491268,0.0002533493],"category_scores_gemma":[0.001602298,0.0002053758,0.00004465682,0.001191716,0.0001667155,0.000448239,0.00001680027,0.0001933612,0.00000395254],"about_ca_system_candidate":true,"about_ca_system_consensus":true,"about_ca_system_score_codex":0.01216593,"about_ca_system_score_gemma":0.03200822,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.02951,"about_ca_topic_score_gemma":0.5542275,"domain_scores_codex":[0.9979648,0.0002982476,0.0006585775,0.0002420452,0.0002575489,0.0005787774],"domain_scores_gemma":[0.9946131,0.0002124554,0.0005756805,0.000213836,0.002736934,0.001648056],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00001149401,0.0002352699,0.2396412,0.00008076155,0.000151552,0.00001359213,0.5777423,0.00001050326,0.0004223804,0.1504569,0.02518578,0.0060482],"study_design_scores_gemma":[0.00032711,0.0002966145,0.2884169,0.0006360714,0.0001818791,0.00003844298,0.5237918,0.00006898435,0.00006897067,0.008874141,0.1768268,0.0004722934],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9743521,0.00005904851,0.004402256,0.01206092,0.004832548,0.0006588269,0.00003657704,0.000007778872,0.00358999],"genre_scores_gemma":[0.9228681,0.00002590381,0.07221851,0.0005677348,0.003668413,0.00003353296,0.00001782201,0.00002117196,0.0005787701],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5247175,"threshold_uncertainty_score":0.9916262,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1838400374076336,"score_gpt":0.4143656325657197,"score_spread":0.2305255951580861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}