{"id":"W1969608664","doi":"10.1207/s15324818ame1703_4","title":"Comparability of Bilingual Versions of Assessments: Sources of Incomparability of English and French Versions of Canada's National Achievement Tests","year":2004,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":62,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Comparability; Differential item functioning; Psychology; Reading (process); Item response theory; Psychometrics; Developmental psychology; Linguistics; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0320853,0.0004879662,0.000537482,0.005197952,0.001374816,0.002484314,0.0009546398,0.0004897254,0.001106408],"category_scores_gemma":[0.1889536,0.0003183168,0.0009230584,0.004289061,0.001523735,0.0009018557,0.002528505,0.0007528128,0.0001518086],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004949719,"about_ca_system_score_gemma":0.003753053,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.1367502,"about_ca_topic_score_gemma":0.1579752,"domain_scores_codex":[0.9503952,0.01915667,0.00426329,0.003551348,0.02090136,0.001732103],"domain_scores_gemma":[0.8395087,0.08366546,0.02170901,0.0120671,0.04122027,0.001829411],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006855741,0.00006081292,0.9507224,0.0001258675,0.00051026,0.0001776721,0.008728288,0.0004190057,0.001699013,0.0007191888,0.0004441222,0.03570781],"study_design_scores_gemma":[0.00001900461,0.0001257553,0.993152,0.00008943384,0.00009837085,0.000223094,0.002251919,0.0008106164,0.001479798,0.0003582015,0.001363946,0.00002796439],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9926063,0.0004927571,0.002086203,0.0002155927,0.00003336086,0.00006888485,0.0006606175,0.00002577077,0.003810533],"genre_scores_gemma":[0.9983359,0.00006911471,0.0007465294,0.00004521537,0.00001012904,0.00002738183,0.0005189297,0.00001394859,0.000232863],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9950503,"threshold_uncertainty_score":0.2719085,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2715701847682983,"score_gpt":0.4269062826454618,"score_spread":0.1553360978771635,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}