{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":7,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":7,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"488d93e32b18","filters":{"venue":"International Journal of Corpus Linguistics"}},"results":[{"id":"W2965104151","doi":"10.1075/ijcl.17088.pic","title":"An introduction to the ANAWC","year":2019,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Assistive Technology in Communication and Mobility","field":"Health Professions","cited_by":41,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université du Québec à Chicoutimi","funders":"","keywords":"Computer science; Resource (disambiguation); Augmentative and alternative communication; Transcription (linguistics); Natural language processing; Linguistics; Human–computer interaction","authors":[{"name":"Lucy Pickering","is_ca":false},{"name":"Laura Di Ferrante","is_ca":false},{"name":"Carrie Bruce","is_ca":false},{"name":"Eric Friginal","is_ca":false},{"name":"Pamela Pearson","is_ca":false},{"name":"Julie Bouchard","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0398078303194553,"gpt":0.4469142243573551,"spread":0.4071063940378998,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005214431,0.0007595573,0.0006768093,0.009403097,0.003717022,0.006393374,0.001780085,0.001390974,0.04651205],"category_scores_gemma":[0.01220198,0.0007600699,0.0004924005,0.01031819,0.002598475,0.004829969,0.00520611,0.003695008,0.02021315],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002459599,"about_ca_system_score_gemma":0.003926259,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006200907,"about_ca_topic_score_gemma":0.009476752,"domain_scores_codex":[0.9944451,0.002299826,0.0007900951,0.0007610076,0.001531617,0.0001722593],"domain_scores_gemma":[0.9898351,0.005021145,0.0004858362,0.001517174,0.002610009,0.0005307689],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00007183125,0.0001215533,0.001615558,0.00155427,0.00001721978,0.0004366518,0.006468131,0.0005666614,0.006289063,0.1306301,0.3145683,0.5376605],"study_design_scores_gemma":[0.000004311178,0.00001149247,0.001038992,0.0004070953,0.00000240172,0.0001951537,0.0005073118,0.0004168113,0.0007630107,0.007660482,0.9889739,0.00001899548],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.01428638,0.0239924,0.3986224,0.02243366,0.01306307,0.004703927,0.04644419,0.006986484,0.4694675],"genre_scores_gemma":[0.06401013,0.01854562,0.6220571,0.005729501,0.005217577,0.01184891,0.05877415,0.008708526,0.2051086],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.04651205,"threshold_uncertainty_score":0.1555983,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2118337010","doi":"10.1075/ijcl.10.2.05lem","title":"Two methods for extracting “specific” single-word terms from specialized corpora","year":2005,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Natural language processing; Artificial intelligence; Word (group theory); Focus (optics); Term (time); Precision and recall; Noun phrase; Recall; Field (mathematics); Noun; Linguistics; Mathematics","authors":[{"name":"Chantal G. Lemay","is_ca":true},{"name":"Marie-Claude L’Homme","is_ca":true},{"name":"Patrick Drouin","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04948392902264137,"gpt":0.3942393048380948,"spread":0.3447553758154535,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005126683,0.001319204,0.001432201,0.014356,0.001173268,0.002536035,0.001561218,0.00114636,0.005834443],"category_scores_gemma":[0.02972778,0.0008680384,0.001471969,0.01476644,0.001292303,0.003570419,0.002457273,0.001183036,0.002491993],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001016532,"about_ca_system_score_gemma":0.001826582,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002251266,"about_ca_topic_score_gemma":0.00502927,"domain_scores_codex":[0.9939601,0.00127506,0.001092515,0.001753697,0.001698157,0.0002204086],"domain_scores_gemma":[0.9867976,0.004253006,0.001738119,0.003357521,0.003550117,0.0003036679],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0005625097,0.0001795704,0.009317426,0.0009573276,0.0003174276,0.0003216084,0.002137924,0.003250317,0.04004342,0.01188041,0.005461734,0.9255704],"study_design_scores_gemma":[0.0008954068,0.001831422,0.1590142,0.0005442246,0.001465403,0.01038955,0.005349222,0.2666615,0.2379858,0.0602417,0.2547033,0.0009183566],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03662081,0.0007078954,0.9525789,0.0001741343,0.0001496058,0.001385854,0.001413311,0.003601949,0.003367472],"genre_scores_gemma":[0.03261529,0.0001930131,0.9623982,0.00003177782,0.00004261302,0.001122404,0.002032875,0.0003079086,0.001256066],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.014356,"threshold_uncertainty_score":0.02711284,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2055171103","doi":"10.1075/ijcl.19.4.04lar","title":"The emergence of implicit meaning","year":2014,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Language, Discourse, Communication Strategies","field":"Arts and Humanities","cited_by":24,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université Laval","funders":"","keywords":"Implicature; Linguistics; Meaning (existential); Interpretation (philosophy); Computer science; Quantifier (linguistics); Corpus linguistics; Natural language processing; Artificial intelligence; Pragmatics; Psychology; Epistemology; Philosophy","authors":[{"name":"Pierre Larrivée","is_ca":false},{"name":"Patrick Duffley","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.030194576368073,"gpt":0.3074147686245207,"spread":0.2772201922564477,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008295324,0.0004299103,0.0006232208,0.001592155,0.001862052,0.00486733,0.001604048,0.001551474,0.006220325],"category_scores_gemma":[0.03771776,0.0007990352,0.0002832564,0.001535066,0.008718305,0.01679421,0.006460492,0.004728089,0.0008646502],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001227238,"about_ca_system_score_gemma":0.001097394,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008285642,"about_ca_topic_score_gemma":0.001109716,"domain_scores_codex":[0.9908625,0.004126772,0.000564463,0.001902646,0.002157945,0.0003856472],"domain_scores_gemma":[0.9595625,0.02368051,0.001971296,0.01085288,0.003489605,0.0004431979],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","study_design_scores_codex":[0.0002012009,0.00006231476,0.007584077,0.0005202471,0.00003683456,0.0007091796,0.06520378,0.0003779491,0.01716531,0.829106,0.001436156,0.0775971],"study_design_scores_gemma":[0.00009806797,0.0002183036,0.02050906,0.0006459346,0.0001155503,0.001971695,0.02276535,0.009864381,0.02107587,0.8060793,0.1165022,0.0001542414],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4925846,0.002063921,0.2834855,0.005279477,0.000389058,0.0002109015,0.0009429339,0.0005313687,0.2145122],"genre_scores_gemma":[0.9692086,0.0003760712,0.02501923,0.0003002693,0.00008130223,0.0001658795,0.0004679519,0.0001997392,0.004181029],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.008295324,"threshold_uncertainty_score":0.04387039,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2985200526","doi":"10.1075/ijcl.18009.hal","title":"<i>Phonological CorpusTools</i>","year":2019,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Phonetics and Phonology Research","field":"Psychology","cited_by":15,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Phonotactics; Phonology; Computer science; Software; Natural language processing; Linguistics; Phonological rule; Artificial intelligence; Neighbourhood (mathematics); Mathematics; Programming language; Philosophy","authors":[{"name":"Kathleen Currie Hall","is_ca":true},{"name":"J. Scott Mackie","is_ca":true},{"name":"Roger Yu-Hsiang Lo","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0293132621904675,"gpt":0.3577817425146209,"spread":0.3284684803241534,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001900353,0.001393547,0.0007405159,0.00459834,0.001083365,0.003283768,0.001595392,0.0006344598,0.17958],"category_scores_gemma":[0.01350052,0.001132024,0.0006790034,0.004545415,0.0009334694,0.002790298,0.002978347,0.001859724,0.05432052],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007158782,"about_ca_system_score_gemma":0.001821793,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002922342,"about_ca_topic_score_gemma":0.004036329,"domain_scores_codex":[0.9987465,0.0002443441,0.0001798102,0.0003180469,0.000434894,0.00007638835],"domain_scores_gemma":[0.9882668,0.006526137,0.0005583203,0.002035733,0.002301649,0.0003114154],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003863793,0.0001045648,0.001551734,0.00129748,0.00005345729,0.0002195847,0.001381669,0.00107747,0.01044636,0.01726681,0.6617693,0.3044452],"study_design_scores_gemma":[0.0002583366,0.00008685106,0.006408609,0.0003335106,0.00003294059,0.0005360302,0.0003685224,0.01135139,0.03409472,0.02290571,0.9234411,0.0001823191],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"software","genre_gemma":"software","genre_scores_codex":[0.00717681,0.0001855852,0.3029304,0.0007397275,0.0005401389,0.001494748,0.2009184,0.4311727,0.05484157],"genre_scores_gemma":[0.04477897,0.0002881172,0.5184499,0.0006242708,0.0003574504,0.007104175,0.2112941,0.1650369,0.05206601],"genre_candidate":"software","genre_consensus":"software","teacher_disagreement_score":0.17958,"threshold_uncertainty_score":0.6007548,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2070354752","doi":"10.1075/ijcl.11.2.04cla","title":"Discovering and organizing noun-verb collocations in specialized corpora using inductive logic programming","year":2006,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Realization (probability); Natural language processing; Computer science; Noun; Artificial intelligence; Verb; Inductive logic programming; Relevance (law); Meaning (existential); Linguistics; Parsing; Mathematics; Psychology; Philosophy","authors":[{"name":"Vincent Claveau","is_ca":false},{"name":"Marie-Claude L’Homme","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02060452257872276,"gpt":0.3012674591553245,"spread":0.2806629365766018,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004415434,0.001297914,0.001203994,0.01149689,0.002152381,0.003580884,0.002249573,0.000922631,0.003084641],"category_scores_gemma":[0.01785681,0.001202661,0.001570262,0.009586083,0.00188178,0.004913494,0.002792645,0.001522542,0.001427429],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001525389,"about_ca_system_score_gemma":0.0024337,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004254276,"about_ca_topic_score_gemma":0.008355218,"domain_scores_codex":[0.9950076,0.001772691,0.0005298585,0.00151084,0.0009851452,0.0001938452],"domain_scores_gemma":[0.9857082,0.01050051,0.001267628,0.001407783,0.0009452682,0.0001705703],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0003664308,0.0004976615,0.02068061,0.002217477,0.0003470303,0.001907884,0.008371279,0.03136775,0.04349623,0.04258265,0.006236067,0.841929],"study_design_scores_gemma":[0.0002907182,0.0003412408,0.02621224,0.0006678398,0.0005401587,0.002401119,0.01073497,0.5967076,0.06047113,0.2069234,0.0943717,0.0003378723],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06067627,0.0004644626,0.9307573,0.000292106,0.00003204104,0.0005263148,0.00167083,0.00251236,0.003068261],"genre_scores_gemma":[0.1070048,0.0002854375,0.8864659,0.00005797893,0.00002681533,0.0005615549,0.004532794,0.0003290286,0.0007356994],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01149689,"threshold_uncertainty_score":0.02335137,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4293147763","doi":"10.1075/ijcl.20024.nai","title":"Handle it in-house?","year":2022,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Social Sciences and Humanities Research Council of Canada","keywords":"Computer science; Sophistication; Vocabulary; Natural language processing; Context (archaeology); Corpus linguistics; Selection (genetic algorithm); Artificial intelligence; Resource (disambiguation); Key (lock); Lexical density; Lexical item; Word lists by frequency; Linguistics","authors":[{"name":"Ben Naismith","is_ca":false},{"name":"Alan Juffs","is_ca":false},{"name":"Na-Rae Han","is_ca":false},{"name":"Daniel Zheng","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02167538962131468,"gpt":0.3440635685827646,"spread":0.3223881789614499,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002095877,0.0003417258,0.0005060676,0.001034185,0.002784233,0.005165935,0.0009416394,0.001518512,0.2859845],"category_scores_gemma":[0.01135888,0.0002433966,0.0002730404,0.0007922193,0.001265823,0.006426644,0.003966117,0.001606365,0.1294746],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001102979,"about_ca_system_score_gemma":0.001079704,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003508825,"about_ca_topic_score_gemma":0.004971804,"domain_scores_codex":[0.9985384,0.000436451,0.00007668305,0.0002414699,0.0004635526,0.0002435233],"domain_scores_gemma":[0.9951775,0.001133076,0.0004937528,0.0009077518,0.001370398,0.0009175381],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001303035,0.0001450524,0.01158358,0.0002282186,0.00001441714,0.001659721,0.01441737,0.00008672548,0.001666657,0.03966767,0.7036217,0.2267786],"study_design_scores_gemma":[0.000005951273,0.00002716893,0.002157562,0.0001361337,0.000005198833,0.0005349405,0.007996854,0.0001799706,0.0006964841,0.004181406,0.984057,0.00002136931],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.06352405,0.001531699,0.01549427,0.05573797,0.006356393,0.0003137176,0.00393213,0.004718528,0.8483913],"genre_scores_gemma":[0.2780348,0.001518738,0.008341121,0.01577958,0.001896538,0.0001948594,0.002377941,0.002866012,0.6889903],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.2859845,"threshold_uncertainty_score":0.9567133,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4321598556","doi":"10.1075/ijcl.21060.hir","title":"“You betcha I’m a ’Merican”","year":2023,"lang":"en","type":"article","venue":"International Journal of Corpus Linguistics","topic":"Linguistic Variation and Morphology","field":"Social Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Complement (music); Linguistics; Interrogative word; Set (abstract data type); Certainty; Computer science; Sociology; History; Philosophy; Epistemology","authors":[{"name":"Tomoharu Hirota","is_ca":true},{"name":"Laurel J. Brinton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03485123383473357,"gpt":0.3681742321877436,"spread":0.33332299835301,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007450901,0.0002410211,0.0002026294,0.0007284523,0.001894244,0.001380154,0.0002852222,0.0004914362,0.01206405],"category_scores_gemma":[0.002683344,0.0001024339,0.00007938172,0.0009189988,0.001672574,0.001417139,0.0009568129,0.000871085,0.001324055],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001057864,"about_ca_system_score_gemma":0.0002997635,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005028161,"about_ca_topic_score_gemma":0.01296414,"domain_scores_codex":[0.9994678,0.0002463954,0.00001833326,0.00007328528,0.0001351542,0.00005909177],"domain_scores_gemma":[0.9989868,0.0004871416,0.0002051737,0.00006259791,0.0001978601,0.00006044696],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"observational","study_design_scores_codex":[0.001125926,0.0003129285,0.05573,0.001079197,0.00008317445,0.003036514,0.4232846,0.0003869951,0.03452607,0.2469208,0.06565225,0.1678616],"study_design_scores_gemma":[0.00002635006,0.0001622507,0.1252374,0.0005338178,0.00004235133,0.002874471,0.2498872,0.001086485,0.01055985,0.00973219,0.5997816,0.00007592585],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6624037,0.002265133,0.004683324,0.003589899,0.0005921213,0.00004148031,0.0006739738,0.00009640341,0.325654],"genre_scores_gemma":[0.9776689,0.0005038358,0.001212999,0.0002826874,0.0001127065,0.00002181062,0.0003461601,0.00009923925,0.01975177],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01206405,"threshold_uncertainty_score":0.04035825,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}