{"id":"W3024691813","doi":"10.48550/arxiv.2005.06012","title":"Mega-COV: A Billion-Scale Dataset of 100+ Languages for COVID-19","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Mega-; Misinformation; Coronavirus disease 2019 (COVID-19); Pandemic; Annotation; Computer science; Scale (ratio); Severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2); 2019-20 coronavirus outbreak; Data science; Information retrieval; Geography; Artificial intelligence; Cartography; Computer security; Biology; Virology; Outbreak; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005045182,0.0001573952,0.0002791161,0.0001824516,0.0002534128,0.00005881289,0.0006946379,0.0002350377,0.0004415153],"category_scores_gemma":[0.000660604,0.0001701624,0.000155223,0.000411871,0.0002415492,0.000288617,0.0003198421,0.0001912489,0.00004185158],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001931148,"about_ca_system_score_gemma":0.0008864159,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003138565,"about_ca_topic_score_gemma":0.001529858,"domain_scores_codex":[0.9989156,0.000128982,0.0002192477,0.0003547198,0.0001312964,0.0002501198],"domain_scores_gemma":[0.9985622,0.0002157764,0.0003367281,0.0004002941,0.0001092369,0.0003757715],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005199712,0.0002626992,0.001528902,0.001541501,0.0003216158,0.00009000903,0.08382532,0.01919864,0.0002339701,0.3414942,0.5497166,0.001266586],"study_design_scores_gemma":[0.001597151,0.0001187919,0.0002765008,0.00009242324,0.0002372262,9.752684e-7,0.04491099,0.009553663,0.0005282323,0.01908112,0.9228837,0.0007192008],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5073547,0.0003044742,0.3125908,0.01197501,0.001702395,0.005467717,0.04274109,0.0009572037,0.1169066],"genre_scores_gemma":[0.9948226,0.0002503553,0.0003646304,0.001599027,0.0001216229,6.144922e-7,0.001403544,0.00001140818,0.001426232],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4874679,"threshold_uncertainty_score":0.6939021,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2151177229130803,"score_gpt":0.3086279761534917,"score_spread":0.09351025324041143,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}