{"id":"W4317467432","doi":"10.1101/2023.01.18.524571","title":"Ensemble of deep learning language models to support the creation of living systematic reviews for the COVID-19 literature","year":2023,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canadian Institutes of Health Research; Horizon 2020 Framework Programme; Innosuisse - Schweizerische Agentur für Innovationsförderung; European Commission; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; National Science Foundation","keywords":"Artificial intelligence; Machine learning; Computer science; Ensemble forecasting; Ranking (information retrieval); Task (project management); Natural language processing; Class (philosophy); Ensemble learning; Systematic review; Data science; Information retrieval; MEDLINE","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005116881,0.0003450902,0.0008118282,0.0002293889,0.0002180297,0.0002834866,0.001958646,0.0002355462,0.000003899758],"category_scores_gemma":[0.005703383,0.000228314,0.0002720152,0.0007711814,0.00004129897,0.0002029993,0.0009859933,0.0004768194,0.000009125065],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000152263,"about_ca_system_score_gemma":0.0003448022,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008356028,"about_ca_topic_score_gemma":0.0000114877,"domain_scores_codex":[0.9969104,0.0005416502,0.001029475,0.0007056915,0.0004611384,0.0003516569],"domain_scores_gemma":[0.9938785,0.002221237,0.001044317,0.002216068,0.0004920872,0.0001477296],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004292943,0.0002108326,0.00091742,0.2233381,0.0008196866,0.00004582221,0.02610903,0.5028839,0.1803078,0.06383856,0.001340818,0.0001450569],"study_design_scores_gemma":[0.0002247371,0.0001429482,0.0004831565,0.02316861,0.000362817,1.482734e-7,0.0001608888,0.9642179,0.009257495,0.00006919719,0.001087457,0.0008246209],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007221634,0.005282057,0.9824252,0.0005710148,0.0005862648,0.003656674,0.00002941263,0.0002229761,0.000004785494],"genre_scores_gemma":[0.9642761,0.0004079988,0.03344204,0.000391611,0.0001758376,0.001211657,2.047681e-7,0.0000592737,0.00003523741],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9570545,"threshold_uncertainty_score":0.9310375,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05301620034303883,"score_gpt":0.2845664423135185,"score_spread":0.2315502419704797,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}