{"id":"W3028968558","doi":"","title":"Collecting Tweets to Investigate Regional Variation in Canadian English","year":2020,"lang":"en","type":"preprint","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Timeline; Computer science; Pipeline (software); Variation (astronomy); Word (group theory); Focus (optics); Crawling; Space (punctuation); Information retrieval; Natural language processing; Similarity (geometry); Relevance (law); Vector space model; World Wide Web; Artificial intelligence; Geography; Linguistics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002562094,0.0003721275,0.0003729468,0.004687094,0.005452829,0.002931361,0.001131528,0.000785822,0.003718234],"category_scores_gemma":[0.01488916,0.0003118838,0.0002908422,0.009420146,0.001420193,0.001135222,0.001603949,0.001035189,0.0006775541],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.02358219,"about_ca_system_score_gemma":0.02592287,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.9807667,"about_ca_topic_score_gemma":0.9873598,"domain_scores_codex":[0.9967216,0.0004588822,0.0001268215,0.0004461943,0.001345194,0.0009014109],"domain_scores_gemma":[0.9849594,0.003888605,0.001195146,0.0006248328,0.008368445,0.0009634176],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006663158,0.0001880946,0.6776279,0.0005605925,0.0002340059,0.0007821178,0.1678704,0.001500423,0.01294942,0.008553193,0.05508418,0.07398343],"study_design_scores_gemma":[0.00001806696,0.00004223119,0.8659026,0.0001134128,0.00009107369,0.00007904579,0.08406104,0.001562694,0.001529041,0.0004936128,0.0460064,0.0001009445],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9660013,0.0004276612,0.001154227,0.001524799,0.0001031395,0.0001647816,0.01321459,0.00006762568,0.01734181],"genre_scores_gemma":[0.9875777,0.0002893184,0.001422574,0.0002596541,0.00003959538,0.000119516,0.003987869,0.00006628062,0.006237439],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02358219,"threshold_uncertainty_score":0.1711016,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03841661960124737,"score_gpt":0.2771601306337848,"score_spread":0.2387435110325374,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}