{"id":"W2805089673","doi":"10.63317/3wos9hprfv6b","title":"You Tweet What You Speak: A City-Level Dataset of Arabic Dialects","year":2018,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":62,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Arabic; Computer science; Natural language processing; Artificial intelligence; Linguistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002183892,0.0007386524,0.0004468475,0.002266857,0.0007440056,0.0005570122,0.0004714534,0.0008882022,0.005014227],"category_scores_gemma":[0.001409898,0.0001580144,0.0004589335,0.002361142,0.0002332637,0.0005419847,0.001004424,0.000576781,0.009686495],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003914273,"about_ca_system_score_gemma":0.0006116063,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02315429,"about_ca_topic_score_gemma":0.04866163,"domain_scores_codex":[0.9997216,0.00005135006,0.0000304887,0.00007152635,0.00006720825,0.00005777821],"domain_scores_gemma":[0.9992551,0.0001650999,0.00006618417,0.0001155486,0.0002240244,0.0001739432],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.002744665,0.001085756,0.1982294,0.002216787,0.0006336486,0.002592729,0.004329031,0.004051197,0.03032833,0.001480897,0.6369579,0.1153497],"study_design_scores_gemma":[0.0002871674,0.0003902048,0.5926418,0.0002005716,0.0002542915,0.002107488,0.008212551,0.01435788,0.008591783,0.001025105,0.3716988,0.0002325355],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.3708929,0.0007715513,0.001594609,0.0005858867,0.0002527098,0.0001402655,0.6177856,0.002045173,0.005931386],"genre_scores_gemma":[0.1883528,0.000277705,0.004251909,0.0001977864,0.0001017071,0.0002438538,0.7999272,0.0001626438,0.00648441],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.02315429,"threshold_uncertainty_score":0.04603904,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03993097122083863,"score_gpt":0.3037672573981623,"score_spread":0.2638362861773237,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}