{"id":"W2885719062","doi":"","title":"Collaboration Between Content Experts and Assessment Specialists: Using a Validity Argument Framework to Develop a College Mathematics Assessment","year":2018,"lang":"en","type":"article","venue":"Canadian Journal of Education / Revue canadienne de l éducation","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University; Institute for Christian Studies; University of Toronto","funders":"","keywords":"Argument (complex analysis); Content validity; Psychology; Educational assessment; Content (measure theory); Mathematics education; Psychometrics; Medicine; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.241456,0.001102585,0.001171235,0.007167653,0.01412459,0.01875712,0.004196483,0.008025181,0.002902735],"category_scores_gemma":[0.3033659,0.001134718,0.001107039,0.002136872,0.02224377,0.02275805,0.02375715,0.008372188,0.0007340386],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.02355295,"about_ca_system_score_gemma":0.05056742,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008870512,"about_ca_topic_score_gemma":0.01364332,"domain_scores_codex":[0.6921466,0.2587712,0.007280485,0.007248647,0.02935499,0.005198099],"domain_scores_gemma":[0.5733722,0.3537756,0.01252006,0.0119735,0.03887396,0.009484662],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0001756192,0.000655427,0.0136677,0.00076484,0.0001083022,0.001957116,0.4738738,0.003010642,0.004017106,0.3419883,0.007847857,0.1519334],"study_design_scores_gemma":[0.0003957034,0.0005321662,0.006957636,0.004053131,0.0001509204,0.001021045,0.2271176,0.0296383,0.006644869,0.5819663,0.141141,0.0003812221],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.147187,0.001197971,0.6295533,0.1017999,0.001007478,0.002366818,0.00004531013,0.0003596531,0.1164826],"genre_scores_gemma":[0.6164377,0.0003033052,0.3743626,0.003141948,0.0001443514,0.001086845,0.00004079244,0.0001002877,0.004382308],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.241456,"threshold_uncertainty_score":0.9354197,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1838400374076336,"score_gpt":0.4143656325657197,"score_spread":0.2305255951580861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}