{"id":"W4415540411","doi":"10.56334/sei/8.12.43","title":"Design, Construction, Validation, and Standardization of a Psychometrically Reliable Mathematical Achievement Test for Grade X Students: An Empirical Study on Reliability, Validity, and Educational Measurement in Secondary Mathematics","year":2025,"lang":"","type":"article","venue":"Science Education and Innovations in the Context of Modern Problems","topic":"Educational Research and Pedagogy","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Standardization; Empirical research; Test (biology); Reliability (semiconductor); Achievement test; Psychometrics; Test validity","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02825164,0.0006659974,0.0005775619,0.002072217,0.000843352,0.002147606,0.001193676,0.0008439996,0.001305135],"category_scores_gemma":[0.04915936,0.0005246351,0.0007834671,0.00142463,0.001291902,0.001214862,0.001595086,0.0008966565,0.0009060554],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001353069,"about_ca_system_score_gemma":0.00694764,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002042887,"about_ca_topic_score_gemma":0.002129649,"domain_scores_codex":[0.9827109,0.009851923,0.002145204,0.001289965,0.003443765,0.0005582327],"domain_scores_gemma":[0.9603557,0.01437959,0.00456173,0.003569234,0.01584328,0.001290597],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0009462989,0.004544895,0.6244228,0.0007102913,0.0001280144,0.0003416968,0.009959822,0.002827795,0.01590112,0.002650921,0.001071507,0.3364949],"study_design_scores_gemma":[0.0007283856,0.02274788,0.8915339,0.0006228315,0.0003015497,0.0004987947,0.01227949,0.01333973,0.04060917,0.001911668,0.01526885,0.0001578681],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9474074,0.0001441223,0.03548898,0.0001492342,0.00005378318,0.01295231,0.0002655402,0.0001457255,0.003393103],"genre_scores_gemma":[0.7892179,0.0003021483,0.1870054,0.0001957165,0.00003439607,0.02030325,0.0008290671,0.00007198654,0.002040048],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02825164,"threshold_uncertainty_score":0.1494107,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1518030546448893,"score_gpt":0.4370921092689152,"score_spread":0.2852890546240259,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}