{"id":"W3024691813","doi":"10.48550/arxiv.2005.06012","title":"Mega-COV: A Billion-Scale Dataset of 100+ Languages for COVID-19","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Mega-; Misinformation; Coronavirus disease 2019 (COVID-19); Pandemic; Annotation; Computer science; Scale (ratio); Severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2); 2019-20 coronavirus outbreak; Data science; Information retrieval; Geography; Artificial intelligence; Cartography; Computer security; Biology; Virology; Outbreak; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["open_science"],"consensus_categories":[],"category_scores_codex":[0.0009366865,0.001311705,0.0007543075,0.003311392,0.001276881,0.001593408,0.001584067,0.002019115,0.01056424],"category_scores_gemma":[0.00774889,0.0004392821,0.001002395,0.005719121,0.0005383978,0.002292989,0.00237209,0.001619219,0.01448369],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001314519,"about_ca_system_score_gemma":0.001443418,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02932201,"about_ca_topic_score_gemma":0.051078,"domain_scores_codex":[0.9987113,0.000341028,0.0001469028,0.0002673199,0.0003454287,0.0001880097],"domain_scores_gemma":[0.9971328,0.0008856768,0.00036118,0.0005978555,0.0006603318,0.0003621223],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002384094,0.0001216751,0.02609564,0.0007755472,0.0001030627,0.0003014276,0.0004582054,0.002836371,0.00119159,0.002585833,0.951398,0.01389432],"study_design_scores_gemma":[0.0002972335,0.000141273,0.0611541,0.0003938538,0.0000756151,0.0007600273,0.001811898,0.02526354,0.002283817,0.006210798,0.9014112,0.0001966089],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0163548,0.0004123539,0.001291777,0.000919731,0.0002362153,0.0001232313,0.9740309,0.001368402,0.005262638],"genre_scores_gemma":[0.01800383,0.0001455259,0.002516743,0.0002606263,0.00007301437,0.0002159934,0.9769788,0.0001791549,0.001626392],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9984159,"threshold_uncertainty_score":0.05830264,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2151177229130803,"score_gpt":0.3086279761534917,"score_spread":0.09351025324041143,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}