{"id":"W3097602436","doi":"10.18653/v1/2020.emnlp-main.648","title":"Multi-XScience: A Large-scale Dataset for Extreme Multi-document Summarization of Scientific Articles","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"HEC Montréal; McGill University","funders":"Institut de Valorisation des Données; Compute Canada; Canadian Institute for Advanced Research","keywords":"Automatic summarization; Computer science; Task (project management); Scale (ratio); Multi-document summarization; Information retrieval; Data science; Natural language processing; Artificial intelligence; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001060386,0.0002236963,0.0003066948,0.000185719,0.0002019474,0.0005920423,0.00209957,0.0001231836,0.00002863108],"category_scores_gemma":[0.0001825873,0.0002075129,0.0001160885,0.0003971267,0.0001015376,0.0004613246,0.003204091,0.0001809817,0.00001842777],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006171024,"about_ca_system_score_gemma":0.0002836617,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000895394,"about_ca_topic_score_gemma":0.0002212089,"domain_scores_codex":[0.9970616,0.00006266152,0.0005922369,0.001328924,0.0005540673,0.0004005166],"domain_scores_gemma":[0.9977668,0.00006572468,0.0002799538,0.001494778,0.0002344835,0.0001582637],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"bench_or_experimental","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001246676,0.007372004,0.01302461,0.006029589,0.0004408801,0.00004582476,0.05506425,0.1837415,0.3683484,0.1038178,0.06885199,0.1931386],"study_design_scores_gemma":[0.0005455746,0.0000196185,0.0002428614,0.00005440167,0.00001374067,6.471629e-7,0.00008502841,0.9837989,0.009921291,0.002255409,0.00283731,0.0002251727],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005731499,0.00007270509,0.9900964,0.0008776761,0.001123185,0.0008476708,0.001122117,0.0001159789,0.00001268907],"genre_scores_gemma":[0.1591548,0.000005157664,0.8391367,0.0001585445,0.0000433258,0.00007955654,0.001034037,0.00001086239,0.0003770451],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.8000575,"threshold_uncertainty_score":0.8462131,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1275074925419956,"score_gpt":0.3234923945206476,"score_spread":0.195984901978652,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}