{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":15,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":15,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"a87db38be0a9","filters":{"venue":"Corpus Linguistics and Linguistic Theory"}},"results":[{"id":"W2803450908","doi":"10.1515/cllt-2016-0078","title":"Unifying dimensions in coherence relations: How various annotation frameworks are related","year":2018,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":71,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"Universiteit Utrecht; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; Deutsche Forschungsgemeinschaft","keywords":"Treebank; Computer science; Annotation; Coherence (philosophical gambling strategy); Dimension (graph theory); Set (abstract data type); Representation (politics); Rhetorical question; Natural language processing; Artificial intelligence; Interface (matter); Linguistics; Programming language; Mathematics","authors":[{"name":"Ted Sanders","is_ca":false},{"name":"Vera Demberg","is_ca":false},{"name":"Jet Hoek","is_ca":false},{"name":"Merel Scholman","is_ca":false},{"name":"Fatemeh Torabi Asr","is_ca":true},{"name":"Sandrine Zufferey","is_ca":false},{"name":"Jacqueline Evers-Vermeul","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01066841424052057,"gpt":0.2592416203831324,"spread":0.2485732061426119,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03531349,0.0007483246,0.0008822095,0.01017228,0.003497493,0.01086655,0.001889282,0.001599173,0.003390228],"category_scores_gemma":[0.1313761,0.001046805,0.0007942686,0.007739642,0.008524878,0.02449765,0.01082873,0.003397983,0.0006181897],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003428434,"about_ca_system_score_gemma":0.003238799,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006837114,"about_ca_topic_score_gemma":0.006671171,"domain_scores_codex":[0.9622121,0.0258933,0.002271811,0.003941842,0.004768954,0.0009119145],"domain_scores_gemma":[0.8836663,0.08192499,0.006693074,0.015607,0.01094596,0.001162666],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0003875284,0.00008431241,0.01233706,0.0006216745,0.00008803532,0.0001528151,0.0525028,0.002923458,0.008466743,0.6697785,0.003368703,0.2492885],"study_design_scores_gemma":[0.00007565854,0.0001267571,0.0144334,0.001081267,0.0001776915,0.0003310534,0.03414431,0.05065297,0.01441896,0.7954169,0.08884978,0.0002913687],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1095403,0.001183895,0.8587389,0.003727543,0.0001946603,0.0002467319,0.000676817,0.001634307,0.02405686],"genre_scores_gemma":[0.6829262,0.0004775109,0.3129224,0.0002915212,0.00005677239,0.0004400823,0.0007274777,0.0006215004,0.001536491],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03531349,"threshold_uncertainty_score":0.1867579,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2315347275","doi":"10.1515/cllt-2014-0020","title":"The meaning of intonation in yes-no questions in American English: A corpus study","year":2014,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Language, Discourse, Communication Strategies","field":"Arts and Humanities","cited_by":58,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Intonation (linguistics); Linguistics; Pitch accent; Utterance; Meaning (existential); Interrogative; Context (archaeology); Sentence; Pitch contour; American English; Stress (linguistics); Phrase; Word order; Psychology; Prosody; History; Philosophy","authors":[{"name":"Nancy Hedberg","is_ca":true},{"name":"Juan Manuel Sosa","is_ca":false},{"name":"Emrah Görgülü","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01725265235915685,"gpt":0.2736270630687182,"spread":0.2563744107095614,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001773366,0.0002108734,0.00024234,0.001187876,0.001520473,0.0009585822,0.0003448854,0.0004872592,0.001462974],"category_scores_gemma":[0.008448016,0.0002140881,0.000139169,0.001618332,0.001890448,0.001082261,0.001108697,0.0006137006,0.0001774398],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005552036,"about_ca_system_score_gemma":0.0004850238,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007423101,"about_ca_topic_score_gemma":0.02033556,"domain_scores_codex":[0.9983877,0.0009711132,0.0001357042,0.0002495625,0.0001844887,0.00007151953],"domain_scores_gemma":[0.9844066,0.01157994,0.001052835,0.0008709501,0.001831612,0.0002580657],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.001294989,0.001044921,0.25072,0.001917378,0.00009459498,0.003180439,0.4903744,0.001044761,0.1241238,0.009226019,0.004956418,0.1120223],"study_design_scores_gemma":[0.00007510514,0.000353458,0.7871794,0.0002614389,0.0000937298,0.003103505,0.1239475,0.004303948,0.02420102,0.001830759,0.05452435,0.0001259541],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9954567,0.0002037925,0.001389901,0.0001199213,0.00001114054,0.00005107923,0.0003096711,0.00001344435,0.002444292],"genre_scores_gemma":[0.9962533,0.000153905,0.002092901,0.00005475357,0.00001375715,0.00007606072,0.0005707368,0.00002053439,0.0007641076],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007423101,"threshold_uncertainty_score":0.01475978,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2756059139","doi":"10.1515/cllt-2016-0052","title":"Common ground across globalized English varieties: A multivariate exploration of mental predicates in World Englishes","year":2017,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":28,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"World Englishes; Irish; Focus (optics); Linguistics; Common ground; Varieties of English; Multivariate statistics; American English; Sociology; Computer science; Philosophy","authors":[{"name":"Sandra C. Deshors","is_ca":false},{"name":"Sandra Götz","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03693167497631163,"gpt":0.3475377057381498,"spread":0.3106060307618382,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002420686,0.0003292045,0.0004291342,0.001912869,0.0008693682,0.003106519,0.0004939663,0.0003032349,0.002915184],"category_scores_gemma":[0.01048362,0.0002428936,0.000769595,0.00171125,0.002113497,0.003011521,0.003359184,0.0009200466,0.0001460631],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008732025,"about_ca_system_score_gemma":0.0004854391,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01376284,"about_ca_topic_score_gemma":0.01066934,"domain_scores_codex":[0.9981635,0.0009388362,0.00007895428,0.0003663382,0.0002684913,0.0001838738],"domain_scores_gemma":[0.992353,0.004845446,0.001269012,0.0007641746,0.0004150822,0.0003533209],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003292735,0.0001806246,0.8503073,0.00006087352,0.0002680666,0.000408156,0.111755,0.001325826,0.005829531,0.007228199,0.0002306871,0.0220764],"study_design_scores_gemma":[0.000008991784,0.0001519142,0.8949324,0.00002662093,0.00007964446,0.0002041949,0.08659803,0.009046356,0.00114626,0.006198622,0.001562107,0.00004482509],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9983754,0.00001359989,0.001003619,0.00003067677,7.799765e-7,0.000005551982,0.00005839387,0.000005186548,0.0005068026],"genre_scores_gemma":[0.9993949,0.000007903191,0.0004044653,0.00000398756,7.705648e-7,0.000006774419,0.00007730239,0.000006536734,0.00009733154],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01376284,"threshold_uncertainty_score":0.02736545,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2068619837","doi":"10.1515/cllt-2014-0011","title":"A multivariate analysis of the Old English ACC+DAT double object alternation","year":2014,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Syntax, Semantics, Linguistic Variation","field":"Arts and Humanities","cited_by":27,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Alternation (linguistics); Linguistics; Object (grammar); Variation (astronomy); Verb; Dative case; Semantics (computer science); Psychology; Computer science; Mathematics; Philosophy","authors":[{"name":"Ludovic De Cuypere","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01790267198612642,"gpt":0.2403187402309355,"spread":0.2224160682448091,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00186354,0.0002114327,0.0003000975,0.0006857325,0.0004354988,0.000776798,0.0002516808,0.0002368578,0.004649846],"category_scores_gemma":[0.01151602,0.00013258,0.0003760117,0.0009922292,0.0005836806,0.000540624,0.0005568012,0.0005283167,0.0003310567],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000247769,"about_ca_system_score_gemma":0.0002155051,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004049846,"about_ca_topic_score_gemma":0.003508596,"domain_scores_codex":[0.9987845,0.0005678947,0.00009376484,0.0002739031,0.0001959632,0.00008398728],"domain_scores_gemma":[0.9866266,0.009960731,0.001514686,0.0007599203,0.0007762305,0.00036191],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001906128,0.0002638721,0.924277,0.0001064087,0.0002901677,0.0009310247,0.006005939,0.0006330508,0.02203344,0.001673339,0.001044962,0.04083458],"study_design_scores_gemma":[0.000009552995,0.0001516258,0.9898013,0.00001242362,0.00008929615,0.000330407,0.001343824,0.004679007,0.001890781,0.0005855724,0.00107917,0.00002695997],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9980294,0.00003142358,0.001225601,0.00002506081,0.000004455078,0.000006448066,0.0001957028,0.00001553004,0.0004664966],"genre_scores_gemma":[0.9990346,0.00001121163,0.0004738072,0.000004139102,0.000003201221,0.00000709043,0.0001645264,0.0000153599,0.0002860621],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.004649846,"threshold_uncertainty_score":0.01555526,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2898954967","doi":"10.1515/cllt-2018-0033","title":"An information-theoretic view on language complexity and register variation: Compressing naturalistic corpus data","year":2018,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Variation (astronomy); Register (sociolinguistics); Linguistics; Formality; Context (archaeology); Conversation; Sentence; Natural language processing; Artificial intelligence","authors":[{"name":"Katharina Ehret","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0309864596405754,"gpt":0.3110136154834371,"spread":0.2800271558428618,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006293701,0.0004419604,0.0008239108,0.007399427,0.001022442,0.004275642,0.001121405,0.000760949,0.002032765],"category_scores_gemma":[0.06627839,0.0003968547,0.0006943898,0.006670884,0.004699458,0.006338381,0.00292101,0.00155188,0.0002548249],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002070961,"about_ca_system_score_gemma":0.0009964107,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004119723,"about_ca_topic_score_gemma":0.003237803,"domain_scores_codex":[0.9948574,0.0025012,0.0004999235,0.0007089337,0.001196863,0.0002356913],"domain_scores_gemma":[0.9391916,0.04629656,0.004048333,0.006931309,0.002918628,0.0006135644],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001437002,0.0002432365,0.08093922,0.0008363771,0.0004462806,0.0007308841,0.008534563,0.1481785,0.01551874,0.3881999,0.004120276,0.3508151],"study_design_scores_gemma":[0.00005523764,0.0003093527,0.07125997,0.0002141042,0.0001134714,0.0007067573,0.003380324,0.4390613,0.00673874,0.4703301,0.007602166,0.0002286057],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5227662,0.0008363198,0.4658628,0.0017028,0.00006656212,0.0001354359,0.002337721,0.0003144384,0.00597774],"genre_scores_gemma":[0.9300447,0.0002809804,0.06617871,0.0001102806,0.0001028833,0.0002094945,0.002245598,0.00009150284,0.0007358855],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007399427,"threshold_uncertainty_score":0.03328466,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4394855929","doi":"10.1515/cllt-2023-0104","title":"Corpus-based discourse analysis: from meta-reflection to accountability","year":2024,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Discourse Analysis in Language Studies","field":"Arts and Humanities","cited_by":17,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Australian Research Data Commons; Simon Fraser University; University of Sydney","keywords":"Accountability; Transparency (behavior); Objectivity (philosophy); Reflexivity; Computer science; Corpus linguistics; Consistency (knowledge bases); Subjectivity; Analytics; Data science; Reflection (computer programming); Discourse analysis; Phenomenon; Epistemology; Linguistics; Sociology; Natural language processing; Political science; Artificial intelligence; Social science; Programming language; Philosophy","authors":[{"name":"Monika Bednarek","is_ca":false},{"name":"Martin Schweinberger","is_ca":false},{"name":"Kelvin K. H. Lee","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04261411326796034,"gpt":0.3263412858121069,"spread":0.2837271725441466,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1964737,0.001211089,0.001508267,0.01305285,0.007986264,0.02692949,0.00476887,0.003297108,0.005113326],"category_scores_gemma":[0.2886644,0.001381546,0.0007673296,0.01138015,0.04171227,0.03509999,0.02092133,0.007755559,0.0008541454],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0136664,"about_ca_system_score_gemma":0.01636032,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004467326,"about_ca_topic_score_gemma":0.003863332,"domain_scores_codex":[0.7570277,0.2111143,0.006128638,0.007554424,0.01660922,0.00156565],"domain_scores_gemma":[0.4653349,0.4480742,0.01294641,0.04781499,0.02343908,0.002390467],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","study_design_scores_codex":[0.00008751999,0.00006456397,0.001932194,0.00105621,0.00009097419,0.0003078941,0.4040633,0.001834393,0.001957145,0.4631736,0.007190738,0.1182415],"study_design_scores_gemma":[0.00004582282,0.00007150746,0.002068485,0.004284828,0.00005859005,0.000249063,0.1450165,0.01308055,0.004654824,0.6626827,0.1676261,0.0001610002],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06458036,0.004693317,0.8018883,0.05717623,0.001328643,0.001578596,0.0007860201,0.001212373,0.06675611],"genre_scores_gemma":[0.6886786,0.002484632,0.296264,0.00196785,0.0004993356,0.002352512,0.0005796658,0.001111694,0.006061756],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1964737,"threshold_uncertainty_score":0.9908909,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2327588828","doi":"10.1515/cllt.2011.008","title":"Safe harbour: Ethics and accessibility in sociolinguistic corpus building","year":2011,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Memorial University of Newfoundland","funders":"","keywords":"Globe; Corpus linguistics; Linguistics; Computer science; Applied linguistics; Computational linguistics; Sociology; Data sharing; Natural language processing; Psychology; Philosophy","authors":[{"name":"Becky Childs","is_ca":false},{"name":"Gerard Van Herk","is_ca":true},{"name":"Jennifer Thorburn","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03852763765365219,"gpt":0.3088898463052056,"spread":0.2703622086515534,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.0769566,0.0004990534,0.0006306929,0.003994546,0.009099717,0.01130363,0.002507004,0.003255495,0.004696524],"category_scores_gemma":[0.1437834,0.001178595,0.000492123,0.003850345,0.02836335,0.02011409,0.01597708,0.004823613,0.001069912],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003469441,"about_ca_system_score_gemma":0.008102502,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003441803,"about_ca_topic_score_gemma":0.004946674,"domain_scores_codex":[0.8815413,0.1062841,0.003011544,0.003240609,0.005018994,0.0009035373],"domain_scores_gemma":[0.8403632,0.1164399,0.00460575,0.02834436,0.008282952,0.001963956],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00006835554,0.00006499829,0.001882301,0.0002215767,0.00001505492,0.0004522931,0.0890399,0.002070119,0.001196903,0.8446196,0.003942955,0.05642598],"study_design_scores_gemma":[0.00003393067,0.00005417289,0.001187615,0.0006198585,0.00001793646,0.0005696744,0.03073915,0.01154721,0.003523467,0.8011368,0.1505052,0.00006507122],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02922508,0.0005501023,0.923438,0.01053818,0.0002368401,0.0008586567,0.0002020562,0.0002842992,0.03466664],"genre_scores_gemma":[0.4612247,0.0005705252,0.5246264,0.001000196,0.0002169306,0.002969128,0.0004359157,0.0005265759,0.008429626],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9967445,"threshold_uncertainty_score":0.4069903,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2332964166","doi":"10.1515/cllt-2013-0014","title":"Topic marking in a Shanghainese corpus: from observation to prediction","year":2013,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Polytomous Rasch model; Computer science; Natural language processing; Logistic regression; Artificial intelligence; Multivariate statistics; Selection (genetic algorithm); Computational linguistics; Machine learning; Statistics; Item response theory; Mathematics; Psychometrics","authors":[{"name":"Weifeng Han","is_ca":false},{"name":"Antti Arppe","is_ca":true},{"name":"John Newman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02289286924627669,"gpt":0.2744754931635357,"spread":0.251582623917259,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002981134,0.0003160675,0.0004077507,0.001757078,0.0005792803,0.001543711,0.0003548808,0.0003649268,0.002069499],"category_scores_gemma":[0.01657699,0.0003300281,0.0002589127,0.003086756,0.0007993223,0.001272693,0.001152458,0.0008349832,0.0007104019],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006143408,"about_ca_system_score_gemma":0.0004621311,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0126662,"about_ca_topic_score_gemma":0.0186706,"domain_scores_codex":[0.9989229,0.0005457941,0.00006944052,0.0002894616,0.0001152225,0.00005714969],"domain_scores_gemma":[0.9782601,0.01765276,0.001134047,0.001436797,0.001272186,0.0002441989],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001115658,0.0001935821,0.7189896,0.0009259523,0.0002925265,0.001306379,0.02614556,0.01261129,0.02175098,0.01017627,0.01649873,0.1899934],"study_design_scores_gemma":[0.00006530641,0.0001063766,0.8568745,0.0001713756,0.0001337592,0.0004776815,0.00676098,0.09567187,0.006215207,0.007315499,0.02607469,0.0001328182],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9769245,0.0007023466,0.01394005,0.0003738598,0.0000487387,0.00003846947,0.004458107,0.0002632238,0.0032506],"genre_scores_gemma":[0.9877334,0.0001810151,0.006000651,0.0000251163,0.00003021513,0.00005087616,0.005073594,0.00008393982,0.0008211443],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0126662,"threshold_uncertainty_score":0.02518493,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2563400189","doi":"10.1515/cllt-2015-0047","title":"Mass counts in World Englishes: A corpus linguistic study of noun countability in non-native varieties of English","year":2016,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University","funders":"York St John University","keywords":"Linguistics; Noun; Syntax; Nominalization; World Englishes; Corpus linguistics; Applied linguistics; Varieties of English; Natural language processing; Computer science; Philosophy","authors":[{"name":"Daniel Schmidtke","is_ca":true},{"name":"Victor Kuperman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01600308910271327,"gpt":0.2859726892322059,"spread":0.2699696001294927,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001413111,0.000231766,0.000390895,0.002622986,0.002100447,0.002174601,0.0005072803,0.0003292597,0.002362401],"category_scores_gemma":[0.008236175,0.0002666342,0.0001495022,0.002987407,0.002215827,0.002370132,0.001824992,0.0007898724,0.0001881708],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008192662,"about_ca_system_score_gemma":0.0004134804,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01638921,"about_ca_topic_score_gemma":0.03809909,"domain_scores_codex":[0.9990428,0.0004556077,0.00009639417,0.0001973192,0.0001437022,0.00006413305],"domain_scores_gemma":[0.9877145,0.008759156,0.00137,0.000774856,0.001101058,0.0002804456],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0007211501,0.0004848881,0.3997958,0.000432855,0.0001558022,0.001720692,0.5309,0.0003222209,0.02473957,0.01293726,0.001383839,0.0264059],"study_design_scores_gemma":[0.00002225435,0.00008713986,0.8452961,0.00005858065,0.00006258129,0.001060454,0.1422497,0.0008933943,0.002662043,0.001476274,0.006080437,0.00005105433],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9983877,0.00005255306,0.0001420098,0.00002513346,0.000001794751,0.000005520162,0.0001198647,0.000002113878,0.001263396],"genre_scores_gemma":[0.9992446,0.00003810694,0.0002156288,0.00001125404,0.000002304841,0.00001193369,0.0002113342,0.000009069544,0.0002558414],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01638921,"threshold_uncertainty_score":0.03258759,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2807690984","doi":"10.1515/cllt-2017-0031","title":"Dependency profiles in the large-scale analysis of discourse connectives","year":2018,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McMaster University; Brock University","funders":"Turun Yliopisto","keywords":"Dependency (UML); Computer science; Syntax; Natural language processing; Scope (computer science); Artificial intelligence; Linguistics; Cluster analysis; Focus (optics); Annotation","authors":[{"name":"Veronika Laippala","is_ca":false},{"name":"Aki-Juhani Kyröläinen","is_ca":true},{"name":"Jenna Kanerva","is_ca":false},{"name":"Filip Ginter","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.00909766402107549,"gpt":0.2919299757573142,"spread":0.2828323117362387,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002752697,0.0003076451,0.0003888071,0.005436469,0.001118649,0.001460055,0.0005216671,0.0004580973,0.001690256],"category_scores_gemma":[0.02017612,0.000311382,0.0003720756,0.005369746,0.0008565122,0.002343908,0.001586274,0.0007139984,0.0003915187],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006949287,"about_ca_system_score_gemma":0.0006118932,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002616636,"about_ca_topic_score_gemma":0.00297735,"domain_scores_codex":[0.9971225,0.001599053,0.0001958342,0.0005567312,0.0004218007,0.0001040025],"domain_scores_gemma":[0.9806595,0.01579552,0.001267169,0.0009758236,0.001008686,0.0002933796],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001958935,0.0006284557,0.3414882,0.001604617,0.0005382732,0.002589856,0.02976373,0.03659714,0.07716006,0.05978592,0.005376163,0.4425086],"study_design_scores_gemma":[0.00006643283,0.0002854382,0.4457504,0.0002856509,0.000279409,0.001860971,0.01337302,0.4016338,0.04212883,0.07123075,0.02290628,0.0001988892],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8931143,0.0003840319,0.1012319,0.0001161829,0.00001633798,0.0001347994,0.001917422,0.0002895597,0.002795661],"genre_scores_gemma":[0.9650618,0.0000842736,0.03331181,0.00001110342,0.000008862354,0.0001285581,0.001068583,0.00004661574,0.0002782821],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005436469,"threshold_uncertainty_score":0.01455778,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3161046106","doi":"10.1515/cllt-2020-0028","title":"Switch-reference and its role in referential choice in Mbyá Guaraní narratives","year":2021,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Syntax, Semantics, Linguistic Variation","field":"Arts and Humanities","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"Social Sciences and Humanities Research Council of Canada; Connaught Fund","keywords":"Ambiguity; Self-reference; Reference model; Computer science; Function (biology); Narrative; Linguistics; Philosophy","authors":[{"name":"Guillaume Thomas","is_ca":true},{"name":"Gregory Antono","is_ca":true},{"name":"Laurestine Bradford","is_ca":true},{"name":"Angelika Kiss","is_ca":true},{"name":"Darragh Winkelman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02712337624769755,"gpt":0.2525062085082269,"spread":0.2253828322605294,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005631533,0.0004015511,0.0005728632,0.002936022,0.002565844,0.003730075,0.0009345298,0.0009003287,0.002641636],"category_scores_gemma":[0.02410982,0.0003705249,0.0001650198,0.003939926,0.004731732,0.004568487,0.004141973,0.001011178,0.0001336365],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003522874,"about_ca_system_score_gemma":0.001238496,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01903174,"about_ca_topic_score_gemma":0.01711286,"domain_scores_codex":[0.9962156,0.002597648,0.00021902,0.0003822138,0.0003309125,0.0002546139],"domain_scores_gemma":[0.9837396,0.01229094,0.002588803,0.0005836053,0.0004893431,0.000307744],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.0004613536,0.00008613242,0.1602661,0.0004591987,0.00007461337,0.00279522,0.6920262,0.0008838702,0.003399047,0.1028303,0.000561915,0.03615604],"study_design_scores_gemma":[0.00006421799,0.0001791558,0.2919516,0.001060653,0.0002057353,0.002451245,0.5620179,0.009577327,0.006238407,0.08965476,0.03638384,0.0002151315],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.989457,0.0009278529,0.001948654,0.0007058383,0.000007195914,0.00001210276,0.00006371328,0.0000129943,0.006864679],"genre_scores_gemma":[0.9992862,0.0001146731,0.0003732738,0.00001348551,0.000001736796,0.000003866067,0.00002029346,0.000004465716,0.0001818535],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01903174,"threshold_uncertainty_score":0.03784192,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4388046533","doi":"10.1515/cllt-2021-0058","title":"Truth be told: a corpus-based study of the cross-linguistic colexification of representational and (inter)subjective meanings","year":2023,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Language, Metaphor, and Cognition","field":"Psychology","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"York University; University of Toronto","funders":"Jackman Humanities Institute, University of Toronto; Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada","keywords":"Linguistics; Focus (optics); Meaning (existential); Corpus linguistics; Variation (astronomy); Computer science; Epistemology; Philosophy","authors":[{"name":"Barend Beekhuizen","is_ca":true},{"name":"M Blumenthal","is_ca":true},{"name":"Lee Jiang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03143056356154125,"gpt":0.3366006567825191,"spread":0.3051700932209779,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007444591,0.0002476923,0.0004839667,0.004796671,0.004131264,0.0035927,0.0008531359,0.0007631942,0.003748862],"category_scores_gemma":[0.03344483,0.0004464837,0.0002032573,0.007602174,0.005957219,0.00418093,0.004300676,0.001943993,0.0003434984],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001864647,"about_ca_system_score_gemma":0.001139542,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007644879,"about_ca_topic_score_gemma":0.01585851,"domain_scores_codex":[0.9951178,0.00336018,0.0003009744,0.000602965,0.0004950503,0.0001230389],"domain_scores_gemma":[0.9530118,0.03798917,0.0023165,0.003488593,0.002755057,0.0004388434],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.000425276,0.0004298009,0.03763762,0.00124405,0.00008192717,0.001692123,0.8193273,0.0007764291,0.01220507,0.06745479,0.005517207,0.05320842],"study_design_scores_gemma":[0.0001463968,0.0002977948,0.2527465,0.001114573,0.0001424439,0.002896392,0.5852292,0.009574,0.01296874,0.02720991,0.1074306,0.0002434249],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9699454,0.0005294885,0.009768025,0.0005167861,0.00006406692,0.0002020364,0.001152962,0.0000425811,0.01777857],"genre_scores_gemma":[0.9910426,0.000212517,0.006164644,0.0000961101,0.00002476352,0.0003158906,0.0008572845,0.00008028584,0.001205744],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007644879,"threshold_uncertainty_score":0.03937125,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4405006658","doi":"10.1515/cllt-2024-0015","title":"A multivariate analysis of canonical and non-canonical uses of switch-reference markers in Mbyá narratives","year":2024,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Syntax, Semantics, Linguistic Variation","field":"Arts and Humanities","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Canonical form; Computer science; Linguistics; Non canonical; Narrative; Epiphenomenon; Argument (complex analysis); Mathematics; Pure mathematics; Philosophy; Medicine","authors":[{"name":"Guillaume Thomas","is_ca":true},{"name":"Germino Duarte","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02490308447191932,"gpt":0.2710907458460139,"spread":0.2461876613740946,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001206216,0.0001864953,0.0002507633,0.00169929,0.0009392712,0.001679052,0.0002939,0.0002758839,0.003258539],"category_scores_gemma":[0.01220687,0.0001887175,0.0002149972,0.002795723,0.001041027,0.001288951,0.001755432,0.0007059248,0.0002962583],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007620993,"about_ca_system_score_gemma":0.0003873177,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01390008,"about_ca_topic_score_gemma":0.01745726,"domain_scores_codex":[0.9991845,0.0003618918,0.0000594211,0.0001819911,0.00009245229,0.0001197154],"domain_scores_gemma":[0.9921522,0.005157412,0.001367771,0.0005315215,0.0004798592,0.0003113167],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0009969563,0.0001418394,0.7798452,0.0002748418,0.0002002358,0.000710159,0.1117181,0.0005556804,0.01485027,0.01216648,0.00202402,0.07651611],"study_design_scores_gemma":[0.000005897246,0.00004327232,0.9624834,0.00004571017,0.00005726722,0.0002994716,0.02748955,0.002259196,0.001217549,0.001237619,0.004834067,0.00002693995],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9969831,0.0001448402,0.0007119023,0.00006781963,0.000003232434,0.00001174397,0.0004079698,0.00001195252,0.001657308],"genre_scores_gemma":[0.9983272,0.00006903269,0.0005895137,0.000007119751,0.00000341426,0.00002019585,0.0004568706,0.00002028809,0.0005063672],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01390008,"threshold_uncertainty_score":0.02763832,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4241042034","doi":"10.1515/cllt-2012-masthead1","title":"Masthead","year":2012,"lang":"en","type":"paratext","venue":"Corpus Linguistics and Linguistic Theory","topic":"Marriage and Sexual Relationships","field":"Social Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science","authors":[{"name":"Stefan Th","is_ca":false},{"name":"Harald Baayen","is_ca":true},{"name":"Holger Diessel","is_ca":false},{"name":"Michelle Gregory","is_ca":true},{"name":"Stefan Grondelaers","is_ca":false},{"name":"Jen Hay","is_ca":false},{"name":"Frank G. Keller","is_ca":false},{"name":"Adam Kilgarriff","is_ca":false},{"name":"Manfred Krug","is_ca":false},{"name":"Katja Markert","is_ca":false},{"name":"Laura A. Michaelis","is_ca":false},{"name":"Douglas Roland","is_ca":false},{"name":"Anna Theakston","is_ca":false},{"name":"Joe Trotta","is_ca":false},{"name":"Eniko Csomay","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04361840048096364,"gpt":0.3318367090971298,"spread":0.2882183086161661,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0007404414,0.0009211908,0.001048752,0.002778281,0.002055695,0.005119067,0.001504055,0.001577488,0.8720393],"category_scores_gemma":[0.003587894,0.0006069368,0.0005344139,0.003437512,0.0005903491,0.004371369,0.002685637,0.001674486,0.7843354],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007197508,"about_ca_system_score_gemma":0.001045906,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003107164,"about_ca_topic_score_gemma":0.00857817,"domain_scores_codex":[0.9994907,0.00007375413,0.00002950344,0.0001367922,0.0002144525,0.00005468755],"domain_scores_gemma":[0.9987374,0.0002795231,0.00005012119,0.0003125645,0.0004392144,0.0001812091],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004272669,0.00001478329,0.00007680484,0.0001088969,0.000001844993,0.00003858846,0.0001139969,0.00005486179,0.0002516205,0.007284439,0.8807048,0.1113066],"study_design_scores_gemma":[0.000005515227,0.000005059571,0.0002362419,0.00004649874,0.000001813867,0.00003892569,0.00006605168,0.00007327057,0.0001651672,0.002617547,0.9967393,0.000004548603],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"other","genre_gemma":"other","genre_scores_codex":[0.0004449357,0.0006146111,0.003259319,0.001018989,0.0006999173,0.00004806277,0.007821128,0.004540292,0.9815528],"genre_scores_gemma":[0.001479412,0.0002177548,0.0009075641,0.0001838859,0.0001118856,0.00003002672,0.002903045,0.001509636,0.9926568],"genre_candidate":"other","genre_consensus":"other","teacher_disagreement_score":0.1279607,"threshold_uncertainty_score":0,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4394842830","doi":"10.1515/cllt-2023-0028","title":"The distributional properties of long nominal compounds in scientific articles: an investigation based on the uniform information density hypothesis","year":2024,"lang":"en","type":"article","venue":"Corpus Linguistics and Linguistic Theory","topic":"Advanced Text Analysis Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Constant (computer programming); Scientific literature; Information transmission; Econometrics; Data science; Information retrieval; Mathematics; Biology","authors":[{"name":"John Gamboa","is_ca":false},{"name":"Kristina Braun","is_ca":false},{"name":"Juhani Järvikivi","is_ca":true},{"name":"Shanley Allen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02148689408851192,"gpt":0.2315409293294229,"spread":0.210054035240911,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.007939612,0.0001546176,0.0004925621,0.005503279,0.001959468,0.003784219,0.0007074168,0.001003872,0.003361433],"category_scores_gemma":[0.0797412,0.0003474703,0.0002643646,0.005582053,0.004439705,0.006436333,0.001962363,0.001086667,0.000447745],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001332394,"about_ca_system_score_gemma":0.0006701931,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001197523,"about_ca_topic_score_gemma":0.001131864,"domain_scores_codex":[0.9936094,0.003128183,0.0007673131,0.0007982272,0.001492736,0.0002040808],"domain_scores_gemma":[0.8100759,0.1524414,0.02027361,0.005514052,0.01013409,0.001560998],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.003401986,0.0005078787,0.4052454,0.002567019,0.0005318078,0.003916723,0.1136098,0.003915786,0.06887725,0.2495372,0.004749567,0.1431396],"study_design_scores_gemma":[0.0001952108,0.0008917869,0.6442823,0.0006737633,0.0003911748,0.004485957,0.08067863,0.04176068,0.02471797,0.1713089,0.03020329,0.0004103051],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9656883,0.0009048847,0.02029175,0.001312006,0.00005115942,0.00007226891,0.0004338141,0.00008207357,0.01116376],"genre_scores_gemma":[0.9964727,0.0001395943,0.002828463,0.00004425098,0.00005091493,0.00003915132,0.0001334398,0.00002512811,0.0002663661],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9944967,"threshold_uncertainty_score":0.04198915,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}