{"id":"W2063611796","doi":"10.1080/15305058.2011.617475","title":"Methodologies for Investigating Item- and Test-Level Measurement Equivalence in International Large-Scale Assessments","year":2012,"lang":"en","type":"article","venue":"International Journal of Testing","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Differential item functioning; Comparability; Psychology; Item response theory; Equivalence (formal languages); Statistics; Nonparametric statistics; Test (biology); Psychometrics; Consistency (knowledge bases); Item analysis; Logistic regression; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.2524046,0.001994926,0.002176189,0.01036387,0.001944027,0.004823984,0.002678857,0.001393407,0.00247911],"category_scores_gemma":[0.6103416,0.001068847,0.002668686,0.01317993,0.003510874,0.003791661,0.006213052,0.002989943,0.0007309797],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002998105,"about_ca_system_score_gemma":0.002870495,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003367323,"about_ca_topic_score_gemma":0.003741974,"domain_scores_codex":[0.6212884,0.288602,0.02540317,0.0162807,0.04702232,0.001403384],"domain_scores_gemma":[0.384278,0.4201937,0.06418706,0.08047258,0.04932238,0.001546309],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001065334,0.0009261222,0.3314597,0.003001188,0.004963999,0.0002311059,0.01359762,0.005574865,0.005091996,0.05039796,0.003323115,0.580367],"study_design_scores_gemma":[0.0008775741,0.008266871,0.7560436,0.003398437,0.00272999,0.001183188,0.009461529,0.03848691,0.01929531,0.1116626,0.04789537,0.0006986004],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1242371,0.002880443,0.845134,0.0004684778,0.0004247422,0.007480901,0.0009797027,0.0005634695,0.01783124],"genre_scores_gemma":[0.4690783,0.0009669635,0.5004395,0.0004656877,0.0002656163,0.02605327,0.001368839,0.0003146579,0.001047125],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.2524046,"threshold_uncertainty_score":0.9219183,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.84777911019985,"score_gpt":0.5833143230805201,"score_spread":0.2644647871193299,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}