{"id":"W4414230855","doi":"10.1109/gem66882.2025.11155795","title":"LADDER: Level Analysis Dataset for Difficulty Evaluation and Ranking","year":2025,"lang":"en","type":"article","venue":"","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Ranking (information retrieval); Bridge (graph theory); Limiting; Resource (disambiguation); Object (grammar); Focus (optics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002163111,0.001792203,0.0009488278,0.005265758,0.0009559832,0.00234111,0.002590786,0.001933667,0.01244508],"category_scores_gemma":[0.011795,0.000390727,0.001451835,0.004161525,0.0005116253,0.002148062,0.00258441,0.002110941,0.01892563],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001515084,"about_ca_system_score_gemma":0.001862216,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01021412,"about_ca_topic_score_gemma":0.02219634,"domain_scores_codex":[0.9969675,0.0004555245,0.0005875573,0.0007099717,0.001000596,0.0002789187],"domain_scores_gemma":[0.9934324,0.001505107,0.0007086157,0.001621506,0.002213029,0.0005192237],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005229251,0.0006528895,0.02219425,0.001232942,0.0001471846,0.0001603896,0.0002922346,0.002625328,0.002109478,0.004275122,0.8963968,0.06939038],"study_design_scores_gemma":[0.0004909034,0.000339182,0.08515497,0.0006332318,0.0001091945,0.0005234156,0.0009861017,0.01699131,0.005175508,0.009528376,0.8798507,0.0002171096],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0141064,0.0003741311,0.008477895,0.0003986416,0.0002006058,0.0006499722,0.9640479,0.004557578,0.007186863],"genre_scores_gemma":[0.01131821,0.0001139865,0.01008429,0.0001239477,0.00003722366,0.00127409,0.974685,0.0002351968,0.002128155],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.01244508,"threshold_uncertainty_score":0.04163289,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07098476990132718,"score_gpt":0.3651269513298248,"score_spread":0.2941421814284976,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}