{"id":"W4416211129","doi":"10.1080/08957347.2025.2563889","title":"Establishing Cognitive Item Models for Fair and Theory-Grounded Automatic Item Generation: A Large-Scale Assessment Study with Image-Based Math Items","year":2025,"lang":"en","type":"article","venue":"Applied Measurement in Education","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Fonds National de la Recherche Luxembourg","keywords":"Item response theory; Cognition; Item analysis; Differential item functioning; Test (biology); Equating; Item bank; Standardized test","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05117789,0.0007503311,0.0006608277,0.002020935,0.0007557858,0.002190012,0.001564421,0.000866116,0.002176311],"category_scores_gemma":[0.1847647,0.0004069969,0.001495628,0.001925,0.001574044,0.001911629,0.002216307,0.001192851,0.0008776564],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001895922,"about_ca_system_score_gemma":0.001652654,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002047197,"about_ca_topic_score_gemma":0.002397181,"domain_scores_codex":[0.9678728,0.02288932,0.001661999,0.003348222,0.0037328,0.0004948641],"domain_scores_gemma":[0.8460369,0.1146894,0.006614748,0.0215278,0.01035392,0.0007772964],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001436796,0.001536863,0.6669604,0.0003956837,0.0005923944,0.0001498693,0.01332681,0.01196126,0.004587791,0.009036559,0.003363338,0.2866523],"study_design_scores_gemma":[0.000854186,0.00370462,0.7694255,0.0004359372,0.0004432409,0.0004908605,0.00532538,0.1660252,0.01276895,0.02791953,0.01236538,0.0002411528],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9021808,0.00008355911,0.09332188,0.0001451102,0.00003694655,0.001590737,0.0004754024,0.0003107462,0.001854767],"genre_scores_gemma":[0.9468212,0.00002472574,0.04963636,0.00005591627,0.000009659628,0.00176521,0.001233989,0.00009250467,0.0003604215],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05117789,"threshold_uncertainty_score":0.2706578,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2627134757698749,"score_gpt":0.4411525673993796,"score_spread":0.1784390916295048,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}