{"id":"W4416035082","doi":"10.18653/v1/2025.emnlp-main.1736","title":"EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs","year":2025,"lang":"","type":"article","venue":"","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Adaptability; Benchmark (surveying); Key (lock); Risk assessment","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.008185371,0.0005426341,0.0006922503,0.0004647666,0.0005501742,0.0006110656,0.00124541,0.0002923759,0.0002024184],"category_scores_gemma":[0.001691603,0.0005386932,0.0002278151,0.00120941,0.0001098607,0.001052856,0.0006451548,0.0006507517,0.00004888615],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005735389,"about_ca_system_score_gemma":0.0008646066,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003106359,"about_ca_topic_score_gemma":0.0008484106,"domain_scores_codex":[0.9940022,0.0009900311,0.001547089,0.001717894,0.0007052648,0.001037547],"domain_scores_gemma":[0.9965001,0.001160122,0.0003771081,0.001290105,0.0005213183,0.0001512652],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001425256,0.000665937,0.009425144,0.0007281386,0.0001130681,0.00001093857,0.001713916,0.01242883,0.001080374,0.7738804,0.007029444,0.1927813],"study_design_scores_gemma":[0.001210069,0.0005517625,0.01912079,0.001752056,0.00005561847,0.000006252988,0.000759754,0.8475863,0.001148237,0.006859822,0.1201812,0.0007681357],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008652597,0.0009482537,0.9795933,0.001811583,0.00458237,0.002153188,0.0005099738,0.00007789862,0.001670863],"genre_scores_gemma":[0.8694035,0.00002973028,0.09830457,0.0004793904,0.0003859321,0.0003247648,0.0004381955,0.00003096813,0.03060299],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8812887,"threshold_uncertainty_score":0.9997064,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1248121147037978,"score_gpt":0.4000493580143543,"score_spread":0.2752372433105565,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}