{"meta":{"query_hash":"488d93e32b18","filters":{"venue":"International Journal of Corpus Linguistics"},"cohort_total":7,"direct_labels_cover":0,"predictions_cover":7,"exported":7,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/488d93e32b18","api":"https://metacan.xera.ac/api/v1/cohort?venue=International+Journal+of+Corpus+Linguistics"},"results":[{"id":"W2055171103","doi":"10.1075/ijcl.19.4.04lar","title":"The emergence of implicit meaning","year":2014,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Language, Discourse, Communication Strategies","field":"Arts and Humanities","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université Laval","funders":"","keywords":"Implicature; Linguistics; Meaning (existential); Interpretation (philosophy); Computer science; Quantifier (linguistics); Corpus linguistics; Natural language processing; Artificial intelligence; Pragmatics; Psychology; Epistemology; Philosophy","score_opus":0.030194576368073003,"score_gpt":0.30741476862452066,"score_spread":0.2772201922564477,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2055171103","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.4925846,0.002063921,0.28348547,0.005279477,0.000389058,0.0002109015,0.0009429339,0.00053136866,0.21451217],"genre_scores_gemma":[0.9692086,0.00037607123,0.025019228,0.00030026925,0.00008130223,0.00016587946,0.00046795188,0.00019973917,0.004181029],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","domain_scores_codex":[0.9908625,0.0041267723,0.00056446303,0.001902646,0.0021579452,0.0003856472],"domain_scores_gemma":[0.95956254,0.023680514,0.0019712963,0.010852878,0.0034896054,0.00044319787],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008295324,0.00042991035,0.00062322075,0.0015921548,0.0018620515,0.0048673297,0.0016040478,0.0015514739,0.0062203254],"category_scores_gemma":[0.03771776,0.00079903525,0.0002832564,0.0015350664,0.008718305,0.01679421,0.0064604925,0.0047280886,0.00086465024],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00020120092,0.00006231476,0.0075840773,0.0005202471,0.000036834565,0.0007091796,0.06520378,0.0003779491,0.01716531,0.829106,0.0014361558,0.077597104],"study_design_scores_gemma":[0.00009806797,0.00021830364,0.02050906,0.0006459346,0.00011555031,0.0019716949,0.022765348,0.009864381,0.021075865,0.80607927,0.11650225,0.00015424137],"about_ca_topic_score_codex":0.00082856417,"about_ca_topic_score_gemma":0.001109716,"teacher_disagreement_score":0.008295324,"about_ca_system_score_codex":0.0012272379,"about_ca_system_score_gemma":0.0010973937,"threshold_uncertainty_score":0.04387039},"labels":[],"label_agreement":null},{"id":"W2070354752","doi":"10.1075/ijcl.11.2.04cla","title":"Discovering and organizing noun-verb collocations in specialized corpora using inductive logic programming","year":2006,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Realization (probability); Natural language processing; Computer science; Noun; Artificial intelligence; Verb; Inductive logic programming; Relevance (law); Meaning (existential); Linguistics; Parsing; Mathematics; Psychology; Philosophy","score_opus":0.02060452257872276,"score_gpt":0.30126745915532455,"score_spread":0.2806629365766018,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2070354752","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06067627,0.00046446256,0.93075734,0.000292106,0.00003204104,0.00052631483,0.0016708298,0.0025123602,0.0030682606],"genre_scores_gemma":[0.10700477,0.00028543753,0.8864659,0.00005797893,0.000026815334,0.00056155486,0.0045327935,0.00032902858,0.0007356994],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99500763,0.0017726908,0.00052985846,0.0015108399,0.0009851452,0.00019384522],"domain_scores_gemma":[0.98570824,0.01050051,0.001267628,0.0014077834,0.0009452682,0.00017057027],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0044154343,0.0012979142,0.0012039939,0.011496893,0.0021523815,0.0035808843,0.002249573,0.000922631,0.0030846407],"category_scores_gemma":[0.017856807,0.0012026608,0.0015702619,0.009586083,0.0018817802,0.0049134935,0.0027926445,0.0015225419,0.0014274293],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00036643082,0.00049766153,0.02068061,0.0022174774,0.0003470303,0.0019078843,0.008371279,0.031367745,0.043496225,0.042582653,0.006236067,0.841929],"study_design_scores_gemma":[0.00029071816,0.00034124078,0.026212242,0.00066783983,0.0005401587,0.0024011186,0.01073497,0.59670764,0.060471132,0.20692341,0.0943717,0.00033787233],"about_ca_topic_score_codex":0.004254276,"about_ca_topic_score_gemma":0.008355218,"teacher_disagreement_score":0.011496893,"about_ca_system_score_codex":0.0015253889,"about_ca_system_score_gemma":0.0024337,"threshold_uncertainty_score":0.023351371},"labels":[],"label_agreement":null},{"id":"W2118337010","doi":"10.1075/ijcl.10.2.05lem","title":"Two methods for extracting “specific” single-word terms from specialized corpora","year":2005,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Word (group theory); Focus (optics); Term (time); Precision and recall; Noun phrase; Recall; Field (mathematics); Noun; Linguistics; Mathematics","score_opus":0.04948392902264137,"score_gpt":0.39423930483809483,"score_spread":0.34475537581545346,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2118337010","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.036620807,0.0007078954,0.9525789,0.00017413427,0.00014960578,0.0013858539,0.0014133112,0.0036019492,0.0033674724],"genre_scores_gemma":[0.032615293,0.00019301311,0.9623982,0.000031777825,0.000042613025,0.0011224045,0.0020328753,0.0003079086,0.0012560664],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.99396014,0.0012750599,0.0010925154,0.0017536967,0.0016981566,0.00022040863],"domain_scores_gemma":[0.98679763,0.004253006,0.0017381189,0.0033575215,0.0035501171,0.00030366788],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005126683,0.0013192042,0.001432201,0.014356004,0.0011732677,0.0025360351,0.0015612176,0.0011463604,0.005834443],"category_scores_gemma":[0.029727785,0.00086803845,0.0014719694,0.014766437,0.001292303,0.003570419,0.0024572732,0.0011830364,0.0024919927],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0005625097,0.00017957043,0.009317426,0.0009573276,0.00031742756,0.00032160836,0.0021379238,0.003250317,0.04004342,0.011880409,0.0054617343,0.92557037],"study_design_scores_gemma":[0.0008954068,0.0018314215,0.15901415,0.0005442246,0.0014654027,0.010389545,0.0053492216,0.26666147,0.23798579,0.060241695,0.2547033,0.00091835664],"about_ca_topic_score_codex":0.0022512656,"about_ca_topic_score_gemma":0.0050292704,"teacher_disagreement_score":0.014356004,"about_ca_system_score_codex":0.0010165316,"about_ca_system_score_gemma":0.0018265818,"threshold_uncertainty_score":0.027112842},"labels":[],"label_agreement":null},{"id":"W2965104151","doi":"10.1075/ijcl.17088.pic","title":"An introduction to the ANAWC","year":2019,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Assistive Technology in Communication and Mobility","field":"Health Professions","cited_by":41,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Computer science; Resource (disambiguation); Augmentative and alternative communication; Transcription (linguistics); Natural language processing; Linguistics; Human–computer interaction","score_opus":0.039807830319455305,"score_gpt":0.4469142243573551,"score_spread":0.40710639403789983,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2965104151","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.014286383,0.0239924,0.39862236,0.022433657,0.0130630685,0.004703927,0.046444185,0.006986484,0.46946752],"genre_scores_gemma":[0.06401013,0.018545622,0.6220571,0.005729501,0.005217577,0.011848911,0.05877415,0.008708526,0.20510864],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99444515,0.0022998264,0.0007900951,0.0007610076,0.0015316173,0.00017225932],"domain_scores_gemma":[0.9898351,0.005021145,0.00048583624,0.0015171744,0.0026100087,0.00053076894],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0052144313,0.0007595573,0.00067680934,0.009403097,0.0037170225,0.0063933744,0.0017800854,0.0013909744,0.046512052],"category_scores_gemma":[0.012201982,0.00076006993,0.00049240055,0.010318185,0.0025984752,0.0048299693,0.00520611,0.003695008,0.020213146],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00007183125,0.00012155333,0.0016155577,0.0015542698,0.000017219782,0.00043665175,0.0064681307,0.00056666136,0.0062890626,0.13063014,0.31456834,0.53766054],"study_design_scores_gemma":[0.0000043111777,0.000011492471,0.0010389922,0.00040709527,0.00000240172,0.00019515365,0.0005073118,0.00041681126,0.0007630107,0.007660482,0.98897386,0.000018995484],"about_ca_topic_score_codex":0.0062009073,"about_ca_topic_score_gemma":0.009476752,"teacher_disagreement_score":0.046512052,"about_ca_system_score_codex":0.002459599,"about_ca_system_score_gemma":0.003926259,"threshold_uncertainty_score":0.15559828},"labels":[],"label_agreement":null},{"id":"W2985200526","doi":"10.1075/ijcl.18009.hal","title":"<i>Phonological CorpusTools</i>","year":2019,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Phonetics and Phonology Research","field":"Psychology","cited_by":15,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Phonotactics; Phonology; Computer science; Software; Natural language processing; Linguistics; Phonological rule; Artificial intelligence; Neighbourhood (mathematics); Mathematics; Programming language; Philosophy","score_opus":0.029313262190467503,"score_gpt":0.3577817425146209,"score_spread":0.32846848032415343,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2985200526","genre_codex":"software","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":"software","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0071768104,0.00018558523,0.30293036,0.0007397275,0.0005401389,0.0014947483,0.2009184,0.43117267,0.05484157],"genre_scores_gemma":[0.044778965,0.0002881172,0.5184499,0.00062427076,0.00035745036,0.007104175,0.21129413,0.16503692,0.052066006],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9987465,0.00024434412,0.00017981017,0.00031804692,0.00043489403,0.00007638835],"domain_scores_gemma":[0.98826677,0.0065261372,0.0005583203,0.0020357328,0.0023016487,0.0003114154],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0019003528,0.0013935467,0.0007405159,0.00459834,0.0010833647,0.0032837682,0.0015953918,0.0006344598,0.17957996],"category_scores_gemma":[0.013500525,0.0011320238,0.0006790034,0.004545415,0.00093346945,0.0027902978,0.002978347,0.0018597238,0.05432052],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00038637925,0.00010456484,0.0015517339,0.0012974796,0.000053457294,0.00021958475,0.0013816688,0.0010774701,0.010446363,0.017266808,0.6617693,0.30444518],"study_design_scores_gemma":[0.00025833663,0.00008685106,0.0064086085,0.00033351057,0.000032940592,0.0005360302,0.0003685224,0.011351392,0.03409472,0.022905705,0.92344105,0.0001823191],"about_ca_topic_score_codex":0.0029223422,"about_ca_topic_score_gemma":0.0040363288,"teacher_disagreement_score":0.17957996,"about_ca_system_score_codex":0.0007158782,"about_ca_system_score_gemma":0.0018217926,"threshold_uncertainty_score":0.6007548},"labels":[],"label_agreement":null},{"id":"W4293147763","doi":"10.1075/ijcl.20024.nai","title":"Handle it in-house?","year":2022,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Computer science; Sophistication; Vocabulary; Natural language processing; Context (archaeology); Corpus linguistics; Selection (genetic algorithm); Artificial intelligence; Resource (disambiguation); Key (lock); Lexical density; Lexical item; Word lists by frequency; Linguistics","score_opus":0.021675389621314683,"score_gpt":0.3440635685827646,"score_spread":0.3223881789614499,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4293147763","genre_codex":"other","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.06352405,0.0015316985,0.015494272,0.05573797,0.0063563925,0.00031371755,0.0039321296,0.004718528,0.8483913],"genre_scores_gemma":[0.27803484,0.0015187383,0.008341121,0.015779579,0.0018965381,0.00019485943,0.002377941,0.0028660123,0.6889903],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9985384,0.00043645102,0.00007668305,0.00024146991,0.00046355257,0.00024352327],"domain_scores_gemma":[0.9951775,0.0011330765,0.0004937528,0.0009077518,0.0013703976,0.0009175381],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002095877,0.00034172577,0.00050606765,0.0010341854,0.002784233,0.0051659346,0.0009416394,0.0015185117,0.28598446],"category_scores_gemma":[0.011358881,0.00024339664,0.00027304035,0.0007922193,0.0012658234,0.0064266436,0.003966117,0.0016063651,0.12947462],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00013030352,0.00014505237,0.011583584,0.00022821856,0.0000144171445,0.0016597206,0.014417365,0.00008672548,0.0016666568,0.039667673,0.70362175,0.22677863],"study_design_scores_gemma":[0.000005951273,0.00002716893,0.0021575617,0.00013613372,0.000005198833,0.0005349405,0.007996854,0.0001799706,0.00069648406,0.004181406,0.984057,0.000021369315],"about_ca_topic_score_codex":0.0035088249,"about_ca_topic_score_gemma":0.0049718036,"teacher_disagreement_score":0.28598446,"about_ca_system_score_codex":0.0011029793,"about_ca_system_score_gemma":0.001079704,"threshold_uncertainty_score":0.9567133},"labels":[],"label_agreement":null},{"id":"W4321598556","doi":"10.1075/ijcl.21060.hir","title":"“You betcha I’m a ’Merican”","year":2023,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Complement (music); Linguistics; Interrogative word; Set (abstract data type); Certainty; Computer science; Sociology; History; Philosophy; Epistemology","score_opus":0.03485123383473357,"score_gpt":0.3681742321877436,"score_spread":0.33332299835301005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4321598556","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6624037,0.0022651327,0.0046833237,0.003589899,0.0005921213,0.00004148031,0.0006739738,0.00009640341,0.325654],"genre_scores_gemma":[0.9776689,0.0005038358,0.0012129995,0.00028268743,0.00011270651,0.000021810618,0.0003461601,0.00009923925,0.019751772],"study_design_codex":"qualitative","study_design_gemma":"observational","domain_scores_codex":[0.9994678,0.0002463954,0.000018333256,0.00007328528,0.0001351542,0.000059091766],"domain_scores_gemma":[0.9989868,0.00048714163,0.00020517372,0.00006259791,0.00019786009,0.000060446964],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007450901,0.00024102106,0.00020262941,0.0007284523,0.0018942442,0.0013801536,0.00028522222,0.0004914362,0.012064051],"category_scores_gemma":[0.002683344,0.00010243388,0.00007938172,0.0009189988,0.0016725742,0.0014171387,0.00095681293,0.00087108504,0.0013240548],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011259263,0.00031292855,0.055729996,0.0010791969,0.000083174455,0.003036514,0.4232846,0.0003869951,0.03452607,0.24692076,0.06565225,0.16786164],"study_design_scores_gemma":[0.00002635006,0.00016225065,0.1252374,0.0005338178,0.00004235133,0.0028744712,0.24988724,0.0010864846,0.010559846,0.00973219,0.59978163,0.000075925855],"about_ca_topic_score_codex":0.005028161,"about_ca_topic_score_gemma":0.012964142,"teacher_disagreement_score":0.012064051,"about_ca_system_score_codex":0.0010578643,"about_ca_system_score_gemma":0.0002997635,"threshold_uncertainty_score":0.040358245},"labels":[],"label_agreement":null}]}