{"id":"W2898954967","doi":"10.1515/cllt-2018-0033","title":"An information-theoretic view on language complexity and register variation: Compressing naturalistic corpus data","year":2018,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Variation (astronomy); Register (sociolinguistics); Linguistics; Formality; Context (archaeology); Conversation; Sentence; Natural language processing; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006293701,0.0004419604,0.0008239108,0.007399427,0.001022442,0.004275642,0.001121405,0.000760949,0.002032765],"category_scores_gemma":[0.06627839,0.0003968547,0.0006943898,0.006670884,0.004699458,0.006338381,0.00292101,0.00155188,0.0002548249],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002070961,"about_ca_system_score_gemma":0.0009964107,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004119723,"about_ca_topic_score_gemma":0.003237803,"domain_scores_codex":[0.9948574,0.0025012,0.0004999235,0.0007089337,0.001196863,0.0002356913],"domain_scores_gemma":[0.9391916,0.04629656,0.004048333,0.006931309,0.002918628,0.0006135644],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001437002,0.0002432365,0.08093922,0.0008363771,0.0004462806,0.0007308841,0.008534563,0.1481785,0.01551874,0.3881999,0.004120276,0.3508151],"study_design_scores_gemma":[0.00005523764,0.0003093527,0.07125997,0.0002141042,0.0001134714,0.0007067573,0.003380324,0.4390613,0.00673874,0.4703301,0.007602166,0.0002286057],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5227662,0.0008363198,0.4658628,0.0017028,0.00006656212,0.0001354359,0.002337721,0.0003144384,0.00597774],"genre_scores_gemma":[0.9300447,0.0002809804,0.06617871,0.0001102806,0.0001028833,0.0002094945,0.002245598,0.00009150284,0.0007358855],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007399427,"threshold_uncertainty_score":0.03328466,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0309864596405754,"score_gpt":0.3110136154834371,"score_spread":0.2800271558428618,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}