{"id":"W4394842830","doi":"10.1515/cllt-2023-0028","title":"The distributional properties of long nominal compounds in scientific articles: an investigation based on the uniform information density hypothesis","year":2024,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Constant (computer programming); Scientific literature; Information transmission; Econometrics; Data science; Information retrieval; Mathematics; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.007939612,0.0001546176,0.0004925621,0.005503279,0.001959468,0.003784219,0.0007074168,0.001003872,0.003361433],"category_scores_gemma":[0.0797412,0.0003474703,0.0002643646,0.005582053,0.004439705,0.006436333,0.001962363,0.001086667,0.000447745],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001332394,"about_ca_system_score_gemma":0.0006701931,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001197523,"about_ca_topic_score_gemma":0.001131864,"domain_scores_codex":[0.9936094,0.003128183,0.0007673131,0.0007982272,0.001492736,0.0002040808],"domain_scores_gemma":[0.8100759,0.1524414,0.02027361,0.005514052,0.01013409,0.001560998],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003401986,0.0005078787,0.4052454,0.002567019,0.0005318078,0.003916723,0.1136098,0.003915786,0.06887725,0.2495372,0.004749567,0.1431396],"study_design_scores_gemma":[0.0001952108,0.0008917869,0.6442823,0.0006737633,0.0003911748,0.004485957,0.08067863,0.04176068,0.02471797,0.1713089,0.03020329,0.0004103051],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9656883,0.0009048847,0.02029175,0.001312006,0.00005115942,0.00007226891,0.0004338141,0.00008207357,0.01116376],"genre_scores_gemma":[0.9964727,0.0001395943,0.002828463,0.00004425098,0.00005091493,0.00003915132,0.0001334398,0.00002512811,0.0002663661],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9944967,"threshold_uncertainty_score":0.04198915,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02148689408851192,"score_gpt":0.2315409293294229,"score_spread":0.210054035240911,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}