{"id":"W4415540411","doi":"10.56334/sei/8.12.43","title":"Design, Construction, Validation, and Standardization of a Psychometrically Reliable Mathematical Achievement Test for Grade X Students: An Empirical Study on Reliability, Validity, and Educational Measurement in Secondary Mathematics","year":2025,"lang":"","type":"article","venue":"Science Education and Innovations in the Context of Modern Problems","topic":"Educational Research and Pedagogy","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Standardization; Empirical research; Test (biology); Reliability (semiconductor); Achievement test; Psychometrics; Test validity","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01486681,0.0002441069,0.0004027984,0.001909669,0.0004709218,0.0004561984,0.0009341459,0.00009152328,0.000009841788],"category_scores_gemma":[0.005898874,0.0002067521,0.00002634914,0.004558897,0.001133713,0.0009157261,0.0002192915,0.000311159,3.558936e-7],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003467435,"about_ca_system_score_gemma":0.007053741,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004431792,"about_ca_topic_score_gemma":0.00004709651,"domain_scores_codex":[0.9951925,0.0003972618,0.001558875,0.0008064737,0.001713345,0.000331567],"domain_scores_gemma":[0.993457,0.001859145,0.0005030054,0.0006898887,0.003379059,0.0001119357],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001254036,0.04586033,0.4414494,0.001545167,0.00005565085,8.779114e-8,0.08513973,0.0007587631,0.002006695,0.3518363,0.000680688,0.07054172],"study_design_scores_gemma":[0.002042495,0.002301173,0.3184605,0.0008628408,0.000041897,0.000008462893,0.01961481,0.01697188,0.0009517579,0.6383414,0.0001179482,0.0002847903],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6084843,0.0003896517,0.3660596,0.02000458,0.000368266,0.004427393,0.00002809213,0.000007619594,0.0002305128],"genre_scores_gemma":[0.9665033,0.000151676,0.03240869,0.0003083584,0.00002484705,0.0005222274,0.00001145541,0.000008304666,0.00006114416],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.358019,"threshold_uncertainty_score":0.9985753,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1518030546448893,"score_gpt":0.4370921092689152,"score_spread":0.2852890546240259,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}