{"id":"W3156095045","doi":"10.18653/v1/2021.eacl-main.298","title":"Mega-COV: A Billion-Scale Dataset of 100+ Languages for COVID-19","year":2021,"lang":"en","type":"article","venue":"","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":32,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Mega-; Coronavirus disease 2019 (COVID-19); Severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2); 2019-20 coronavirus outbreak; Scale (ratio); Computer science; Volume (thermodynamics); Virology; Geography; Medicine; Physics; Cartography; Astronomy; Outbreak","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001673772,0.002478663,0.001551894,0.005794719,0.002064671,0.002918006,0.003128065,0.002473918,0.01881218],"category_scores_gemma":[0.007750504,0.0009571448,0.001828578,0.007966746,0.0008409126,0.003731456,0.005177834,0.002353365,0.04250275],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00120885,"about_ca_system_score_gemma":0.003054568,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02613006,"about_ca_topic_score_gemma":0.05246777,"domain_scores_codex":[0.9976999,0.0005274888,0.0003086239,0.0006474389,0.00049323,0.0003233232],"domain_scores_gemma":[0.9965457,0.0007372525,0.0002379148,0.001047447,0.0009298739,0.0005017686],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002903638,0.00009659813,0.007612635,0.001054483,0.0001740357,0.0002828439,0.0003514097,0.0007568752,0.001190045,0.001644028,0.9732607,0.01328589],"study_design_scores_gemma":[0.000424254,0.00009280795,0.0244233,0.0005641569,0.0001247368,0.0006748964,0.001369786,0.004350462,0.00204997,0.003328689,0.9624546,0.0001423322],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.006152691,0.000617877,0.0009007469,0.0003119201,0.0001787205,0.00006105546,0.9857309,0.003131097,0.00291492],"genre_scores_gemma":[0.002454095,0.00006966149,0.001314145,0.00007484142,0.00001520467,0.00006488855,0.9952166,0.0002683829,0.0005222203],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.02613006,"threshold_uncertainty_score":0.06293303,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08159894887163349,"score_gpt":0.438370599910293,"score_spread":0.3567716510386595,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}