{"id":"W2796847126","doi":"10.2307/1602249","title":"Test Construction and Validation: Case Description of Constructing and Validating a Test of English for Teaching Purposes","year":2002,"lang":"en","type":"article","venue":"Canadian Journal of Education / Revue canadienne de l éducation","topic":"Educational Technology and Assessment","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"","funders":"","keywords":"Test (biology); Computer science; Mathematics education; Psychology; Geology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008296633,0.0001025863,0.0001855083,0.0005484504,0.0002331862,0.00007607146,0.0001675604,0.00008472904,0.00001097165],"category_scores_gemma":[0.006578329,0.0001215149,0.0000350172,0.0002574314,0.0001782653,0.000655974,0.000009941225,0.0001716623,9.576166e-8],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000462526,"about_ca_system_score_gemma":0.001592605,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001760085,"about_ca_topic_score_gemma":0.008143882,"domain_scores_codex":[0.998972,0.00006567401,0.0005274904,0.0001745199,0.00004818562,0.0002121536],"domain_scores_gemma":[0.9968516,0.0006105569,0.0007839297,0.0001764285,0.001263232,0.0003142907],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"qualitative","study_design_scores_codex":[0.000004113366,0.0003071004,0.3586769,0.0007627498,0.00008880979,0.00001825578,0.1421508,0.00005855256,0.007577871,0.2266442,0.002235187,0.2614755],"study_design_scores_gemma":[0.003081163,0.002431724,0.04315844,0.00406026,0.000735496,0.06054413,0.7423716,0.009314471,0.03815084,0.07016744,0.0241631,0.001821375],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9851281,0.000365678,0.01067344,0.001552706,0.001718165,0.0001980795,0.00001992602,0.000007389605,0.0003365169],"genre_scores_gemma":[0.8976125,0.00001884369,0.1020181,0.00003745204,0.0002317557,0.00001508077,0.00000613721,0.000006960087,0.00005323691],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6002207,"threshold_uncertainty_score":0.787535,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04615243925074911,"score_gpt":0.2699627301624387,"score_spread":0.2238102909116896,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}