{"meta":{"query_hash":"488d93e32b18","filters":{"venue":"International Journal of Corpus Linguistics"},"cohort_total":7,"direct_labels_cover":0,"predictions_cover":7,"exported":7,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/488d93e32b18","api":"https://metacan.xera.ac/api/v1/cohort?venue=International+Journal+of+Corpus+Linguistics"},"results":[{"id":"W2055171103","doi":"10.1075/ijcl.19.4.04lar","title":"The emergence of implicit meaning","year":2014,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Language, Discourse, Communication Strategies","field":"Arts and Humanities","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Implicature; Linguistics; Meaning (existential); Interpretation (philosophy); Computer science; Quantifier (linguistics); Corpus linguistics; Natural language processing; Artificial intelligence; Pragmatics; Psychology; Epistemology; Philosophy","score_opus":0.030194576368073003,"score_gpt":0.30741476862452066,"score_spread":0.2772201922564477,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2055171103","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.07223705,0.0021323664,0.0068995627,0.0025801116,0.023759348,0.00012770426,0.000058679827,0.00004354254,0.8921616],"genre_scores_gemma":[0.9957603,0.0001900018,0.0005437108,0.000087247485,0.002795446,6.404853e-7,0.0000021945482,0.000009127667,0.00061128504],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.99886155,0.000055008233,0.000522288,0.00004530575,0.00042927114,0.00008657805],"domain_scores_gemma":[0.9958698,0.00044587647,0.00071622,0.00017966572,0.0027569146,0.00003152393],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00045827386,0.00007082614,0.00012345056,0.00006779526,0.00013101859,0.00014731335,0.0008650683,0.000016625883,0.00018167184],"category_scores_gemma":[0.0022191224,0.000046842084,0.000089737376,0.00001767585,0.00020872167,0.000047812242,0.00006870152,0.00013524992,0.000006812676],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00001942491,0.000025271536,0.0004408078,0.000003089392,0.00007497824,0.0000030785461,0.0038737697,0.00009918855,0.00009195305,0.99051225,0.0019400284,0.002916158],"study_design_scores_gemma":[0.0002727153,0.00008165754,0.00026791013,0.00008978034,0.00004034059,0.000020852884,0.005141827,0.0004291881,0.00054591737,0.09068189,0.9023339,0.00009397889],"about_ca_topic_score_codex":0.00008000074,"about_ca_topic_score_gemma":0.00036250267,"teacher_disagreement_score":0.9235233,"about_ca_system_score_codex":0.000014245194,"about_ca_system_score_gemma":0.00006520416,"threshold_uncertainty_score":0.2656657},"labels":[],"label_agreement":null},{"id":"W2070354752","doi":"10.1075/ijcl.11.2.04cla","title":"Discovering and organizing noun-verb collocations in specialized corpora using inductive logic programming","year":2006,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Realization (probability); Natural language processing; Computer science; Noun; Artificial intelligence; Verb; Inductive logic programming; Relevance (law); Meaning (existential); Linguistics; Parsing; Mathematics; Psychology; Philosophy","score_opus":0.02060452257872276,"score_gpt":0.30126745915532455,"score_spread":0.2806629365766018,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2070354752","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.1276342,0.0009631068,0.86882126,0.00022587567,0.0020078823,0.000110416615,0.0000034882721,0.000056894394,0.00017686855],"genre_scores_gemma":[0.5658462,0.000013333577,0.4334516,0.000032959648,0.0006385467,5.493895e-7,0.0000011289754,0.0000065973036,0.0000090738195],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99873793,0.0000352907,0.0005034377,0.00015382488,0.00042366318,0.00014587882],"domain_scores_gemma":[0.9978311,0.000112591166,0.0006036628,0.000099141784,0.0013125979,0.00004088216],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000296507,0.000117609336,0.00018512656,0.00035521775,0.000062269675,0.00035194686,0.0006245954,0.00005895846,0.0000012499983],"category_scores_gemma":[0.0013106563,0.00011023113,0.000038060953,0.00032683674,0.00006410813,0.00026051348,0.00019525456,0.00023845154,3.6662118e-7],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000058654197,0.00028051028,0.038222767,0.000029662788,0.00006356197,0.0012907089,0.0012180476,0.0008609506,0.012124526,0.9308323,0.00006708914,0.014951168],"study_design_scores_gemma":[0.0033474613,0.00030361643,0.007860321,0.001802885,0.00009647652,0.0024298918,0.00040813547,0.04231433,0.031690933,0.891643,0.016941488,0.0011614617],"about_ca_topic_score_codex":0.00033202316,"about_ca_topic_score_gemma":0.00012221669,"teacher_disagreement_score":0.438212,"about_ca_system_score_codex":0.00028018624,"about_ca_system_score_gemma":0.00021324324,"threshold_uncertainty_score":0.4495095},"labels":[],"label_agreement":null},{"id":"W2118337010","doi":"10.1075/ijcl.10.2.05lem","title":"Two methods for extracting “specific” single-word terms from specialized corpora","year":2005,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Word (group theory); Focus (optics); Term (time); Precision and recall; Noun phrase; Recall; Field (mathematics); Noun; Linguistics; Mathematics","score_opus":0.04948392902264137,"score_gpt":0.39423930483809483,"score_spread":0.34475537581545346,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2118337010","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0009768362,0.0021813025,0.9878409,0.0007980194,0.0071834987,0.00009788697,0.000015109075,0.00011495103,0.0007915175],"genre_scores_gemma":[0.1397375,0.000052265586,0.8503307,0.0003554514,0.0094185155,0.0000022122304,0.0000066846965,0.000020664447,0.00007597752],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9980213,0.00008868048,0.0008717804,0.00024279958,0.00056294294,0.00021249511],"domain_scores_gemma":[0.9946083,0.0011671275,0.0013751282,0.00025073474,0.0024874047,0.000111323294],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008607631,0.0001868573,0.00031020644,0.00027447473,0.00007368414,0.00050506537,0.0019676993,0.00008464156,0.000024710753],"category_scores_gemma":[0.004652236,0.00016840137,0.00019574363,0.0001344984,0.00005097329,0.00028658798,0.0001910534,0.00032942425,0.0000039946176],"study_design_candidate":"design_other","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00015452493,0.00017183815,0.00024254597,0.0000045072584,0.000092179595,0.00014199472,0.00033675798,0.0000586352,0.025849534,0.1277813,0.0013920631,0.84377414],"study_design_scores_gemma":[0.0013624214,0.00010542829,0.000055047723,0.00021667985,0.000032378586,0.00021846045,0.000013409411,0.0099968705,0.12411497,0.28093877,0.5826383,0.00030721264],"about_ca_topic_score_codex":0.000015484582,"about_ca_topic_score_gemma":0.000008131463,"teacher_disagreement_score":0.8434669,"about_ca_system_score_codex":0.00025596732,"about_ca_system_score_gemma":0.00011319926,"threshold_uncertainty_score":0.68672085},"labels":[],"label_agreement":null},{"id":"W2965104151","doi":"10.1075/ijcl.17088.pic","title":"An introduction to the ANAWC","year":2019,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Assistive Technology in Communication and Mobility","field":"Health Professions","cited_by":41,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Computer science; Resource (disambiguation); Augmentative and alternative communication; Transcription (linguistics); Natural language processing; Linguistics; Human–computer interaction","score_opus":0.039807830319455305,"score_gpt":0.4469142243573551,"score_spread":0.40710639403789983,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2965104151","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.84667075,0.00012120475,0.020075386,0.07669195,0.04565843,0.00059838087,0.000035948542,0.00009097002,0.010056995],"genre_scores_gemma":[0.98846304,0.000030923555,0.0031787693,0.0018513713,0.0057714065,0.000004824884,0.0000070453366,0.000008848693,0.00068377145],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.9987309,0.00022858704,0.00051161577,0.00009431622,0.0003181281,0.00011643427],"domain_scores_gemma":[0.9953128,0.00034803385,0.0004773344,0.00044761767,0.0033482374,0.00006597947],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011127274,0.00006592199,0.0001272674,0.0001304919,0.00013753951,0.000011646902,0.0009600652,0.00008304569,0.00032752927],"category_scores_gemma":[0.004703844,0.000045649744,0.00004704357,0.00009624117,0.000047409012,0.000032123648,0.00011640407,0.00057645707,0.00020584208],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049782253,0.00032815992,0.63304526,0.000015107647,0.0001673011,0.00001351352,0.0015132716,0.00089633843,0.0016111583,0.2521828,0.0881898,0.02153942],"study_design_scores_gemma":[0.00030230428,0.00012750887,0.05212001,0.000026736283,0.000012351626,0.000009987715,0.00056098605,0.00026287595,0.00009496677,0.0015655437,0.94486654,0.00005017364],"about_ca_topic_score_codex":0.000024812913,"about_ca_topic_score_gemma":0.00009541135,"teacher_disagreement_score":0.85667676,"about_ca_system_score_codex":0.00018376837,"about_ca_system_score_gemma":0.00018757554,"threshold_uncertainty_score":0.56312805},"labels":[],"label_agreement":null},{"id":"W2985200526","doi":"10.1075/ijcl.18009.hal","title":"<i>Phonological CorpusTools</i>","year":2019,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Phonetics and Phonology Research","field":"Psychology","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Phonotactics; Phonology; Computer science; Software; Natural language processing; Linguistics; Phonological rule; Artificial intelligence; Neighbourhood (mathematics); Mathematics; Programming language; Philosophy","score_opus":0.029313262190467503,"score_gpt":0.3577817425146209,"score_spread":0.32846848032415343,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2985200526","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9005131,0.0006822043,0.0009923145,0.00060842134,0.03917392,0.000105311155,0.000032820906,0.000022145494,0.057869725],"genre_scores_gemma":[0.99323785,0.000096436066,0.0006133593,0.00047759566,0.002179011,0.0000013353151,0.0000057976185,0.000016154068,0.0033724683],"study_design_codex":"observational","study_design_gemma":"not_applicable","domain_scores_codex":[0.9985339,0.000079331214,0.0005073295,0.00014474777,0.00050194724,0.00023274327],"domain_scores_gemma":[0.9973245,0.0003634794,0.0003806683,0.00019802124,0.0016212678,0.00011205153],"candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0004052208,0.00011276283,0.0002354115,0.0002141641,0.000021850541,0.000046815563,0.00084752304,0.00014855443,0.0024179283],"category_scores_gemma":[0.0010671208,0.00009576054,0.00013664158,0.000081377824,0.00009686342,0.000018877683,0.00010447353,0.00048219677,0.0009508896],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0032717749,0.00179367,0.44060713,0.00002076862,0.0018774888,0.005033782,0.0031207225,0.000582518,0.011290856,0.4160334,0.09009757,0.02627031],"study_design_scores_gemma":[0.0023852054,0.0007253627,0.067315,0.000047385303,0.000032885247,0.0010616237,0.00012986797,0.0001726557,0.0010162457,0.010949157,0.9159503,0.00021433212],"about_ca_topic_score_codex":0.000037381436,"about_ca_topic_score_gemma":0.0000052779787,"teacher_disagreement_score":0.8258527,"about_ca_system_score_codex":0.00006242493,"about_ca_system_score_gemma":0.00011375652,"threshold_uncertainty_score":0.99982697},"labels":[],"label_agreement":null},{"id":"W4293147763","doi":"10.1075/ijcl.20024.nai","title":"Handle it in-house?","year":2022,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Computer science; Sophistication; Vocabulary; Natural language processing; Context (archaeology); Corpus linguistics; Selection (genetic algorithm); Artificial intelligence; Resource (disambiguation); Key (lock); Lexical density; Lexical item; Word lists by frequency; Linguistics","score_opus":0.021675389621314683,"score_gpt":0.3440635685827646,"score_spread":0.3223881789614499,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293147763","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.7686142,0.008047077,0.0029880402,0.0031386574,0.07423307,0.0001716962,0.0000636849,0.00009693341,0.14264664],"genre_scores_gemma":[0.99092716,0.000007695644,0.00033584883,0.0052661747,0.0019041571,0.0000027447484,0.0000044414082,0.000019702373,0.0015320847],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.9988542,0.00011420193,0.0004207374,0.00008257014,0.00041211466,0.00011618459],"domain_scores_gemma":[0.99893904,0.00017956336,0.00034152338,0.00008539286,0.00040735916,0.00004714114],"candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.00044382122,0.00006445302,0.00012250977,0.00031481587,0.000047802332,0.000028879254,0.00039876156,0.00002610209,0.029620538],"category_scores_gemma":[0.00088352576,0.000067613335,0.00007860919,0.0000957239,0.00002040678,0.000016133894,0.00006664395,0.00039179815,0.000057120036],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0034711135,0.0034320066,0.14678966,0.000019938308,0.0013165602,0.052874703,0.064145744,0.018484881,0.0011339997,0.41167185,0.23214349,0.06451606],"study_design_scores_gemma":[0.0014115501,0.00015428691,0.0059989393,0.000017359553,0.000012428482,0.000879333,0.0031848687,0.000113549606,0.00003106768,0.00092527457,0.9871777,0.00009363122],"about_ca_topic_score_codex":0.00005468959,"about_ca_topic_score_gemma":0.000011342081,"teacher_disagreement_score":0.7550342,"about_ca_system_score_codex":0.00011645097,"about_ca_system_score_gemma":0.000064356485,"threshold_uncertainty_score":0.9712665},"labels":[],"label_agreement":null},{"id":"W4321598556","doi":"10.1075/ijcl.21060.hir","title":"“You betcha I’m a ’Merican”","year":2023,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Complement (music); Linguistics; Interrogative word; Set (abstract data type); Certainty; Computer science; Sociology; History; Philosophy; Epistemology","score_opus":0.03485123383473357,"score_gpt":0.3681742321877436,"score_spread":0.33332299835301005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4321598556","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"codex-gemma-dda1882f352a","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.17744854,0.0004769518,0.024648007,0.041912787,0.24972016,0.00048808265,0.0001862057,0.0006548355,0.50446445],"genre_scores_gemma":[0.98226213,0.00033236382,0.0021191004,0.0006753816,0.010645914,0.0000010632409,0.000008747778,0.00001215106,0.0039431634],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","domain_scores_codex":[0.99846435,0.00008806524,0.0004209448,0.00008427581,0.0007559208,0.00018645456],"domain_scores_gemma":[0.9961811,0.0003503714,0.00042914576,0.00007248711,0.0028324442,0.00013446051],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0009232286,0.00006915075,0.00014725009,0.00028517345,0.00011418371,0.00007044199,0.00052509335,0.00006760774,0.00023530138],"category_scores_gemma":[0.023190143,0.000067727065,0.00009939359,0.00024939873,0.00013688047,0.000024749948,0.000050420407,0.00014341623,0.00012726654],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000057389603,0.000085208936,0.017066544,0.000003036883,0.000140986,0.0009673615,0.006111677,0.00019639982,0.00010982629,0.9382038,0.028621104,0.008436662],"study_design_scores_gemma":[0.0003435466,0.000035228575,0.0018698091,0.00001808842,0.00002004716,0.000019921526,0.0005875023,0.000118475706,0.000040867988,0.013509485,0.9833631,0.000073950105],"about_ca_topic_score_codex":0.00036124102,"about_ca_topic_score_gemma":0.0001324747,"teacher_disagreement_score":0.95474195,"about_ca_system_score_codex":0.00011592885,"about_ca_system_score_gemma":0.00046767792,"threshold_uncertainty_score":0.9850379},"labels":[],"label_agreement":null}]}