{"id":"W7090319786","doi":"10.5281/zenodo.17339096","title":"Dataset for: SESR-Eval: Dataset for Evaluating LLMs in the Title-Abstract Screening of Systematic Reviews","year":2025,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Scopus; Documentation; Replication (statistics); Python (programming language); License; Systematic review; Publication","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.01132766,0.002394514,0.003361008,0.006892581,0.001178925,0.004717812,0.003456993,0.002872827,0.322434],"category_scores_gemma":[0.1135337,0.001480169,0.00478333,0.009537262,0.0006796243,0.002665846,0.004148861,0.002703848,0.08961768],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004043733,"about_ca_system_score_gemma":0.009796871,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00826854,"about_ca_topic_score_gemma":0.02166399,"domain_scores_codex":[0.9866763,0.004282614,0.004201483,0.002303789,0.002033493,0.0005023156],"domain_scores_gemma":[0.9141405,0.05337178,0.009288592,0.008612692,0.01318444,0.00140198],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003335558,0.00003039195,0.0008017414,0.02517137,0.0003307987,0.00003915324,0.00006344104,0.000557265,0.0002205059,0.001130015,0.9647478,0.00657384],"study_design_scores_gemma":[0.005563468,0.000200866,0.01034456,0.01446974,0.0009759628,0.0001893862,0.000158964,0.001349777,0.0008458636,0.007046058,0.9586359,0.0002193682],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0001619868,0.0002214004,0.0005175618,0.0002875452,0.00007673448,0.0007132762,0.9963127,0.0006958069,0.001013051],"genre_scores_gemma":[0.001900422,0.0003596235,0.006308084,0.0007249974,0.00008833873,0.0146558,0.972594,0.0008678486,0.002500881],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9886723,"threshold_uncertainty_score":0.9664657,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8172144440829286,"score_gpt":0.5510569691749024,"score_spread":0.2661574749080262,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}