{"id":"W2002384848","doi":"10.1111/j.1745-3992.2002.tb00103.x","title":"What Do School‐Level Scores From Large‐Scale Assessments Really Measure?","year":2002,"lang":"en","type":"article","venue":"Educational Measurement Issues and Practice","topic":"Cognitive Abilities and Testing","field":"Psychology","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Public Health","funders":"","keywords":"Reading (process); Scale (ratio); Variance (accounting); Psychology; Cognition; Measure (data warehouse); Subject (documents); Illusion; Mathematics education; Cognitive psychology; Computer science; Linguistics; Data mining","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03268831,0.0009292655,0.001778054,0.005404849,0.0006705684,0.003971464,0.001924586,0.002854183,0.001513432],"category_scores_gemma":[0.1700092,0.0004342166,0.0008685076,0.00557355,0.003404573,0.006482118,0.001506127,0.001826352,0.001617217],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001134883,"about_ca_system_score_gemma":0.001299076,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004373445,"about_ca_topic_score_gemma":0.008270957,"domain_scores_codex":[0.9839517,0.007113536,0.001938902,0.001693773,0.004821048,0.0004810106],"domain_scores_gemma":[0.8693184,0.0658543,0.02274621,0.01358469,0.02548541,0.003010892],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00009423312,0.0001886263,0.8025778,0.0006706264,0.0006675349,0.00007343938,0.004396125,0.0006442324,0.0005050607,0.003374386,0.01112951,0.1756784],"study_design_scores_gemma":[0.00004715119,0.0004565548,0.9618918,0.0007461768,0.0003117224,0.0003725226,0.003961861,0.002018998,0.0009979142,0.01644321,0.01265361,0.00009870264],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8612076,0.01008666,0.04156512,0.01904782,0.002364371,0.0005587204,0.003760676,0.0008739569,0.06053505],"genre_scores_gemma":[0.9798135,0.002029156,0.01264614,0.001864617,0.0007024847,0.0003733855,0.001224313,0.0001730636,0.001173387],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03268831,"threshold_uncertainty_score":0.1728743,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2066488833662569,"score_gpt":0.420967314211943,"score_spread":0.2143184308456861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}