{"id":"W3121686920","doi":"10.1186/s13643-021-01583-y","title":"Considerations for conducting systematic reviews: evaluating the performance of different methods for de-duplicating references","year":2021,"lang":"en","type":"article","venue":"Systematic Reviews","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":238,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kingston Health Sciences Centre; Queen's University","funders":"","keywords":"Systematic review; Medicine; PsycINFO; Flagging; Information retrieval; Computer science; MEDLINE; Set (abstract data type); Data mining; Database; Data science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"design_other","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.8686191,0.006073485,0.01352436,0.04079577,0.007878048,0.02187724,0.01202882,0.01117912,0.004441273],"category_scores_gemma":[0.9585925,0.007145667,0.01818328,0.03908678,0.01364615,0.02418316,0.009994539,0.007007428,0.002008265],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.01746589,"about_ca_system_score_gemma":0.05619411,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007390449,"about_ca_topic_score_gemma":0.01705137,"domain_scores_codex":[0.0394521,0.676125,0.2102863,0.01015101,0.0629537,0.00103181],"domain_scores_gemma":[0.01336284,0.869911,0.04889503,0.0244066,0.04225218,0.001172432],"domain_codex":"methods","domain_gemma":"methods","domain_candidate":"methods","domain_consensus":"methods","study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.006208855,0.000817754,0.04981479,0.2979533,0.02455296,0.001328641,0.03798281,0.006193086,0.004774466,0.02679825,0.02461037,0.5189648],"study_design_scores_gemma":[0.0101763,0.009965397,0.07181439,0.4702643,0.04881406,0.006337443,0.02113768,0.04715138,0.02069154,0.1200228,0.1693941,0.004230566],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0556998,0.131779,0.5612215,0.0518302,0.009807404,0.1685628,0.005384343,0.002869881,0.01284512],"genre_scores_gemma":[0.07663357,0.009684281,0.8259044,0.003905498,0.0008052421,0.08146743,0.0008417753,0.0003444474,0.0004133632],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1313809,"threshold_uncertainty_score":0.162016,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.9330778224572595,"score_gpt":0.6546697466149455,"score_spread":0.278408075842314,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}