{"id":"W4388574245","doi":"10.1111/jedm.12380","title":"Incorporating Test‐Taking Engagement into Multistage Adaptive Testing Design for Large‐Scale Assessments","year":2023,"lang":"en","type":"article","venue":"Journal of Educational Measurement","topic":"Psychometric Methodologies and Testing","field":"Decision Sciences","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Operationalization; Computerized adaptive testing; Test (biology); Item response theory; Premise; Scale (ratio); Computer science; Test design; Reliability (semiconductor); Psychology; Applied psychology; Reliability engineering; Psychometrics; Statistics; Test method; Mathematics; Engineering; Clinical psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0544481,0.001120078,0.001013719,0.001430539,0.0005934411,0.001374537,0.002086142,0.001062347,0.002785292],"category_scores_gemma":[0.1143834,0.0009288852,0.001187059,0.001014941,0.001352158,0.001445156,0.002151364,0.001795675,0.0003053778],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001464484,"about_ca_system_score_gemma":0.002019703,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001605403,"about_ca_topic_score_gemma":0.002718061,"domain_scores_codex":[0.9399657,0.0535828,0.001501577,0.001967381,0.00252439,0.0004580639],"domain_scores_gemma":[0.8539311,0.1237603,0.007735856,0.007303696,0.006039959,0.001229156],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00733927,0.004464655,0.08690108,0.00114174,0.001498597,0.0002975975,0.004118375,0.349202,0.01775998,0.03776472,0.00183483,0.4876771],"study_design_scores_gemma":[0.0005078462,0.005707873,0.01963861,0.0001132501,0.0001653675,0.00005734214,0.0001965099,0.9477413,0.004967511,0.01893658,0.001859839,0.0001079353],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09671128,0.000058739,0.898973,0.00009943646,0.00003830065,0.002823567,0.00005767325,0.0004189435,0.0008189985],"genre_scores_gemma":[0.3860466,0.00003565036,0.6073614,0.00005798008,0.00001451145,0.006062838,0.00009207285,0.0000436244,0.0002852839],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0544481,"threshold_uncertainty_score":0.2879525,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8135852760237042,"score_gpt":0.547201763889805,"score_spread":0.2663835121338992,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}