{"id":"W2005408543","doi":"10.1191/0265532204lt292oa","title":"Test decisions over time: tracking validity","year":2004,"lang":"en","type":"article","venue":"Language Testing","topic":"EFL/ESL Teaching and Learning","field":"Arts and Humanities","cited_by":69,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University","funders":"","keywords":"Test (biology); Psychology; Sample (material); Active listening; Test validity; Applied psychology; Social psychology; Mathematics education; Psychometrics; Developmental psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1224852,0.0005251965,0.0007695573,0.005914486,0.002040442,0.004325276,0.002666495,0.001454551,0.001409485],"category_scores_gemma":[0.4049832,0.0006602926,0.00139995,0.005900171,0.003730278,0.005367981,0.006512977,0.002184071,0.0005205143],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003582884,"about_ca_system_score_gemma":0.004035691,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01571751,"about_ca_topic_score_gemma":0.01146669,"domain_scores_codex":[0.9097165,0.04730969,0.008921941,0.009625874,0.02177192,0.002654027],"domain_scores_gemma":[0.4533105,0.3706812,0.08062076,0.05320383,0.03950938,0.002674302],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003391801,0.0002117839,0.921078,0.0001258579,0.0002026776,0.00007472829,0.01153623,0.001216883,0.0005204959,0.003101398,0.0004475926,0.06114526],"study_design_scores_gemma":[0.00008925429,0.0009019149,0.9472898,0.0002719667,0.0001649461,0.0002626238,0.008427924,0.01603126,0.00411244,0.01288039,0.00943786,0.0001296748],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9551107,0.0004793142,0.02808628,0.0007952903,0.0001213139,0.001084961,0.0008830409,0.0001678499,0.01327132],"genre_scores_gemma":[0.9877666,0.000112852,0.008922825,0.0001366039,0.00003814238,0.001001881,0.0006341611,0.00005267294,0.001334183],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1224852,"threshold_uncertainty_score":0.6477714,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1004204092065655,"score_gpt":0.2939022965666889,"score_spread":0.1934818873601234,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}