{"id":"W7117361401","doi":"10.51798/sijis.v6i4.1177","title":"Validation of tests using an argument-based approach: a review based on the PRISMA model","year":2025,"lang":"","type":"article","venue":"Sapienza International Journal of Interdisciplinary Studies","topic":"Student Assessment and Feedback","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Barrie Urology Group","funders":"","keywords":"Relevance (law); Empirical research; Reliability (semiconductor); Quality (philosophy); Process (computing); Test (biology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.003867933,0.0004169752,0.0008730064,0.0006415949,0.0006877041,0.0001618985,0.001932162,0.0001135105,0.0001293726],"category_scores_gemma":[0.0007245151,0.0002865442,0.0006798645,0.0007379271,0.0007865354,0.0006394699,0.0007324778,0.0005042544,0.000003344298],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008054269,"about_ca_system_score_gemma":0.0008896493,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000007693577,"about_ca_topic_score_gemma":0.000008325504,"domain_scores_codex":[0.9945016,0.0006999021,0.001891855,0.000402654,0.002156923,0.0003470664],"domain_scores_gemma":[0.9933897,0.0009059216,0.002317286,0.0003699039,0.002920329,0.00009683471],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006984767,0.0305967,0.03387611,0.005818815,0.02025162,0.0001609688,0.1341701,0.6522951,0.003294178,0.03509896,0.05825424,0.01919848],"study_design_scores_gemma":[0.00573656,0.003084534,0.004441535,0.06189773,0.002923225,0.00001614827,0.1240477,0.7746292,0.002608424,0.01851183,0.0008397416,0.001263322],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7114835,0.04007259,0.06583773,0.1226082,0.01339265,0.003624615,0.000156638,0.00006043145,0.04276364],"genre_scores_gemma":[0.9913061,0.002808772,0.003287192,0.001834629,0.000425616,0.00002391171,0.000008694201,0.00002002794,0.0002850337],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2798226,"threshold_uncertainty_score":0.9999587,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1165376039611564,"score_gpt":0.4520148118121817,"score_spread":0.3354772078510253,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}