{"id":"W7130683390","doi":"10.1109/swc65939.2025.00073","title":"Can Question Validation Criteria Improve the Quality of LLM-Generated Multiple-Choice Questions?","year":2025,"lang":"","type":"article","venue":"","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Athabasca University","funders":"Alberta Innovates; Natural Sciences and Engineering Research Council of Canada; Athabasca University","keywords":"Formative assessment; Quality (philosophy); Set (abstract data type); Subject-matter expert; Quality assurance; Key (lock); Subject (documents)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.09528947,0.001550386,0.00109183,0.002546967,0.0006309638,0.003399061,0.002411273,0.002019466,0.003112529],"category_scores_gemma":[0.4845497,0.0005711771,0.0008244853,0.001365073,0.001312721,0.004907543,0.002859982,0.001434538,0.001422607],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001457144,"about_ca_system_score_gemma":0.001750761,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001218317,"about_ca_topic_score_gemma":0.0012722,"domain_scores_codex":[0.8928583,0.08104622,0.006499467,0.006589144,0.01187577,0.001131079],"domain_scores_gemma":[0.3663052,0.5135809,0.0303577,0.03009091,0.05777052,0.0018948],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002139217,0.001266731,0.04507375,0.002653695,0.0001842788,0.0002084738,0.009968588,0.006527586,0.05305804,0.002775169,0.004466714,0.8716777],"study_design_scores_gemma":[0.001543639,0.01048551,0.2412928,0.004423055,0.0007243927,0.001790267,0.008951049,0.3295132,0.3146508,0.02571018,0.05997183,0.0009432566],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3904373,0.001432306,0.5840762,0.00267319,0.0004527414,0.003187663,0.000542837,0.009663574,0.007534124],"genre_scores_gemma":[0.6481428,0.0002254965,0.3478896,0.0004952854,0.00008614398,0.001145667,0.0005460712,0.0005537728,0.0009152147],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9047105,"threshold_uncertainty_score":0.5039449,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05532363522220222,"score_gpt":0.4307930285494517,"score_spread":0.3754693933272495,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}