{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":6,"total_is_capped":false,"direct_labels_cover":0,"predictions_cover":6,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"627b644e1b00","filters":{"venue":"Journal of Data Mining & Digital Humanities"}},"results":[{"id":"W4392910228","doi":"10.46298/jdmdh.10403","title":"Exploring Data Provenance in Handwritten Text Recognition Infrastructure: Sharing and Reusing Ground Truth Data, Referencing Models, and Acknowledging Contributions. Starting the Conversation on How We Could Get It Done","year":2024,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Research Data Management Practices","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"Nederlandse Organisatie voor Wetenschappelijk Onderzoek","keywords":"Conversation; Ground truth; Reuse; Provenance; Computer science; Natural language processing; Artificial intelligence; Linguistics; Engineering; Geology; Philosophy","authors":[{"name":"Christel Annemieke Romein","is_ca":false},{"name":"Tobias Hodel","is_ca":false},{"name":"Femke Gordijn","is_ca":false},{"name":"Joris van Zundert","is_ca":false},{"name":"Alix Chagué","is_ca":true},{"name":"Milan van Lange","is_ca":false},{"name":"Helle Strandgaard Jensen","is_ca":false},{"name":"Andy Stauder","is_ca":false},{"name":"Jake Purcell","is_ca":false},{"name":"Melissa Terras","is_ca":false},{"name":"Pauline van den Heuvel","is_ca":false},{"name":"Carlijn Keijzer","is_ca":false},{"name":"Achim Rabus","is_ca":false},{"name":"Chantal Sitaram","is_ca":false},{"name":"Aakriti Bhatia","is_ca":false},{"name":"Katrien Depuydt","is_ca":false},{"name":"Mary Aderonke Afolabi-Adeolu","is_ca":false},{"name":"Anastasiia Anikina","is_ca":false},{"name":"Elisa Bastianello","is_ca":false},{"name":"Lukas Vincent Benzinger","is_ca":false},{"name":"Arno Bosse","is_ca":false},{"name":"David Brown","is_ca":false},{"name":"Ash Charlton","is_ca":false},{"name":"André Nilsson Dannevig","is_ca":false},{"name":"Klaas Van Gelder","is_ca":false},{"name":"Sabine Go","is_ca":false},{"name":"Marcus J.C. Goh","is_ca":false},{"name":"Silvia Gstrein","is_ca":false},{"name":"Sewa Hasan","is_ca":false},{"name":"Stefan von der Heide","is_ca":false},{"name":"Maximilian Hindermann","is_ca":false},{"name":"Dorothee Huff","is_ca":false},{"name":"Ineke Huysman","is_ca":false},{"name":"Ali Idris","is_ca":false},{"name":"Liesbeth Keijzer","is_ca":false},{"name":"Simon Kemper","is_ca":false},{"name":"Sanne Koenders","is_ca":false},{"name":"Erika Kuijpers","is_ca":false},{"name":"Lisette Rønsig Larsen","is_ca":false},{"name":"Sven Lepa","is_ca":false},{"name":"Tommy O. Link","is_ca":false},{"name":"Annelies van Nispen","is_ca":false},{"name":"Joseph Nockels","is_ca":false},{"name":"Laura M. van Noort","is_ca":false},{"name":"Joost Johannes Oosterhuis","is_ca":false},{"name":"Vivien Popken","is_ca":false},{"name":"María Estrella Puertollano","is_ca":false},{"name":"Joosep J. Puusaag","is_ca":false},{"name":"Ahmed Sheta","is_ca":false},{"name":"Lex Stoop","is_ca":false},{"name":"Ebba Strutzenbladh","is_ca":false},{"name":"N. van der Sijs","is_ca":false},{"name":"Jan Paul van der Spek","is_ca":false},{"name":"Barry Benaissa Trouw","is_ca":false},{"name":"Geertrui Van Synghel","is_ca":false},{"name":"Vladimir Vučković","is_ca":false},{"name":"Heleen Wilbrink","is_ca":false},{"name":"Sonia Weiss","is_ca":false},{"name":"David Joseph Wrisley","is_ca":false},{"name":"Riet Zweistra","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.5182855834595688,"gpt":0.373077971203399,"spread":0.1452076122561697,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.1208475,0.0009528724,0.0009480806,0.008774965,0.008615511,0.02051342,0.005146106,0.00443366,0.003964064],"category_scores_gemma":[0.3070134,0.001556907,0.001349388,0.01021246,0.01494214,0.05838966,0.02388536,0.006101493,0.002212277],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005608904,"about_ca_system_score_gemma":0.01521038,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008733978,"about_ca_topic_score_gemma":0.0123382,"domain_scores_codex":[0.9046659,0.06023973,0.00799027,0.009406211,0.01552585,0.00217196],"domain_scores_gemma":[0.6136292,0.1441497,0.02350303,0.1681485,0.04616965,0.004399866],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.0004901526,0.0002618553,0.02764613,0.001639182,0.0001798846,0.001748602,0.223014,0.005844741,0.008992393,0.2335556,0.01488023,0.4817472],"study_design_scores_gemma":[0.00006180987,0.0002575799,0.006776614,0.003721126,0.0001960944,0.001324597,0.0804686,0.01417001,0.02274277,0.4680932,0.401806,0.0003815137],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0865043,0.003468381,0.823488,0.04668201,0.001330318,0.001043614,0.001580721,0.003038085,0.03286453],"genre_scores_gemma":[0.404315,0.001836351,0.5742006,0.00248382,0.0004473657,0.0006849903,0.002207689,0.001909561,0.01191464],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9948539,"threshold_uncertainty_score":0.6391101,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3125727712","doi":"10.46298/jdmdh.21","title":"Deception in Speeches of Candidates for Public Office","year":2015,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Media Influence and Politics","field":"Social Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Royal Military College of Canada; Queen's University","funders":"","keywords":"Deception; Persona; Subconscious; Perception; Psychology; Presidential system; Skepticism; Social psychology; Perspective (graphical); Politics; Cognitive psychology; Computer science; Political science; Epistemology; Artificial intelligence; Human–computer interaction; Law; Philosophy","authors":[{"name":"David B. Skillicorn","is_ca":true},{"name":"Christian Leuprecht","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3966178400552383,"gpt":0.3990141504154591,"spread":0.002396310360220755,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004607094,0.0003338362,0.0003832854,0.001729433,0.001234027,0.002808438,0.0004534567,0.001306343,0.003947326],"category_scores_gemma":[0.07143185,0.0002165201,0.000227593,0.001489969,0.0009824529,0.002011767,0.001515619,0.001586948,0.001469235],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007924659,"about_ca_system_score_gemma":0.0003284108,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001717439,"about_ca_topic_score_gemma":0.002195413,"domain_scores_codex":[0.9941618,0.003160549,0.000540877,0.0004992829,0.00135543,0.0002820908],"domain_scores_gemma":[0.911198,0.06038071,0.01783556,0.004334404,0.005262882,0.0009885055],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.004299632,0.0006452367,0.3631485,0.001738342,0.0005071181,0.004045389,0.2133336,0.003767809,0.03607497,0.03449016,0.02357632,0.314373],"study_design_scores_gemma":[0.00007170084,0.0006686884,0.7590351,0.001005746,0.0002496429,0.002680535,0.06329352,0.02427828,0.01825902,0.02030988,0.1097199,0.0004281602],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.972235,0.001364477,0.007427953,0.002473221,0.0005265017,0.00006066309,0.001063305,0.00006896571,0.01477979],"genre_scores_gemma":[0.9925175,0.000398351,0.001870563,0.0003021191,0.000338374,0.00004679912,0.0006066876,0.00003702391,0.003882627],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.004607094,"threshold_uncertainty_score":0.02436495,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2802812759","doi":"10.46298/jdmdh.4457","title":"Prosopographical data analysis. Application to the Angevin officers (XIII–XV centuries)","year":2018,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Medieval European Literature and History","field":"Arts and Humanities","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Moncton","funders":"Agence Nationale de la Recherche","keywords":"Prosopography; Relation (database); Online analytical processing; History; Visualization; Classics; Data science; Computer science; Database; Data warehouse; Data mining","authors":[{"name":"Anne Tchounikine","is_ca":false},{"name":"Maryvonne Miquel","is_ca":false},{"name":"Thierry Pécout","is_ca":false},{"name":"Jean-Luc Bonnaud","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1025658813022736,"gpt":0.2855709712024714,"spread":0.1830050899001978,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009228631,0.000318597,0.000183922,0.0094179,0.0008860434,0.001356347,0.0003703398,0.000319196,0.01298999],"category_scores_gemma":[0.003676629,0.0001846777,0.0002280609,0.01297273,0.000443675,0.0007865581,0.001384619,0.0004658669,0.00216308],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004301321,"about_ca_system_score_gemma":0.0006636154,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008215651,"about_ca_topic_score_gemma":0.01538332,"domain_scores_codex":[0.9996607,0.00008278203,0.00004011118,0.00008878988,0.00009007569,0.00003739397],"domain_scores_gemma":[0.9979838,0.0009208155,0.0003309149,0.0002921291,0.000347527,0.0001247456],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.000550835,0.0002084323,0.2325621,0.001793888,0.0001361549,0.002350417,0.04494331,0.00434846,0.00897697,0.03405302,0.05139667,0.6186798],"study_design_scores_gemma":[0.00004583605,0.000102194,0.4524474,0.0004718565,0.00006604094,0.001263901,0.03446335,0.01172501,0.007054798,0.01195863,0.4803299,0.00007110082],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6250687,0.001475388,0.0689223,0.0009018512,0.0002565742,0.001126302,0.2009917,0.002772752,0.09848444],"genre_scores_gemma":[0.7564513,0.001264305,0.1566146,0.00007479762,0.0001240524,0.002419174,0.06506408,0.0005208554,0.01746672],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01298999,"threshold_uncertainty_score":0.0434559,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4225331178","doi":"10.46298/jdmdh.9123","title":"Towards an empirical evaluation of translated texts and translation quality","year":2022,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université du Québec à Trois-Rivières","funders":"","keywords":"Computer science; Machine translation; Natural language processing; Phraseology; Source text; Artificial intelligence; Context (archaeology); Quality (philosophy); Translation (biology); Linguistics","authors":[{"name":"É. Poirier","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2710737773030953,"gpt":0.4273664435802014,"spread":0.156292666277106,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1096792,0.001648914,0.001583508,0.01161798,0.001295366,0.008555014,0.002676128,0.002551382,0.006669734],"category_scores_gemma":[0.4075953,0.0007758859,0.001064213,0.01337088,0.007156247,0.01044962,0.006679961,0.002449366,0.002183257],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002321492,"about_ca_system_score_gemma":0.002766139,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001503113,"about_ca_topic_score_gemma":0.0009654546,"domain_scores_codex":[0.8055444,0.1300425,0.0131502,0.01119476,0.03883269,0.001235484],"domain_scores_gemma":[0.5494729,0.2975434,0.0410354,0.04148311,0.06808916,0.002375958],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.001261264,0.001561215,0.2139689,0.005643629,0.001402917,0.0005024355,0.02055697,0.0184587,0.01037857,0.1049327,0.01343072,0.6079019],"study_design_scores_gemma":[0.0005740297,0.003506098,0.4276375,0.00587844,0.001383713,0.001590173,0.02112822,0.168788,0.03840054,0.2302571,0.1001939,0.0006623501],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2259994,0.00581876,0.7210785,0.002609718,0.0003137764,0.00181292,0.002801961,0.001252506,0.03831253],"genre_scores_gemma":[0.7347958,0.001489247,0.2532876,0.0004437496,0.0003359493,0.00258176,0.003720505,0.0007277898,0.002617711],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.1096792,"threshold_uncertainty_score":0.5800459,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4394803700","doi":"10.46298/jdmdh.10542","title":"The Challenges of HTR Model Training: Feedback from the Project Donner le gout de l'archive a l'ere numerique","year":2023,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Mathematics, Computing, and Information Processing","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Université du Québec à Rimouski; Université de Montréal","funders":"Social Sciences and Humanities Research Council of Canada; Université de Montréal; Université de Sherbrooke; Université du Québec à Rimouski","keywords":"Training (meteorology); Gout; Psychology; Computer science; Physical medicine and rehabilitation; Medicine; Physics; Internal medicine; Meteorology","authors":[{"name":"Beatrice Couture","is_ca":true},{"name":"Farah Verret","is_ca":true},{"name":"Maxime Gohier","is_ca":true},{"name":"Dominique Deslandres","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1937526202284116,"gpt":0.3030778760184903,"spread":0.1093252557900787,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05488778,0.001814651,0.001267357,0.001436511,0.002441131,0.00455283,0.003301616,0.003965957,0.004898823],"category_scores_gemma":[0.2198616,0.0006168705,0.0007748522,0.00143358,0.002688622,0.00611901,0.004392203,0.00496253,0.003665967],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003115735,"about_ca_system_score_gemma":0.00441302,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02024098,"about_ca_topic_score_gemma":0.02462396,"domain_scores_codex":[0.9609237,0.02109456,0.001501567,0.003354879,0.01216963,0.0009556477],"domain_scores_gemma":[0.764484,0.1633603,0.002780766,0.009714476,0.05442378,0.005236635],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.001345299,0.002293376,0.02512748,0.002025627,0.0001674059,0.001680717,0.04706011,0.04532412,0.0159805,0.007673424,0.1838963,0.6674256],"study_design_scores_gemma":[0.0003116349,0.002142872,0.02721535,0.001828591,0.000159803,0.002350607,0.04741642,0.2136307,0.03976279,0.01414187,0.6505331,0.0005062303],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5534803,0.009655227,0.2774715,0.07768201,0.003524279,0.001277089,0.005904861,0.01043854,0.06056619],"genre_scores_gemma":[0.7349923,0.004416643,0.2043813,0.00579787,0.0007883044,0.0006786363,0.01068632,0.004282117,0.03397656],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05488778,"threshold_uncertainty_score":0.2902778,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4402821732","doi":"10.46298/jdmdh.12520","title":"Temporal Sequencing of Documents","year":2024,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Semantic Web and Ontologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Computational biology; Information retrieval; Biology","authors":[{"name":"Michael Gervers","is_ca":true},{"name":"Gelila Tilahun","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1301717141655876,"gpt":0.3188513975220842,"spread":0.1886796833564967,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001587731,0.0006453149,0.0006278071,0.004792945,0.001320749,0.001978841,0.001058673,0.0004989595,0.004829048],"category_scores_gemma":[0.01340539,0.0005462496,0.0006463157,0.00562512,0.0005215108,0.002426075,0.001298346,0.001232258,0.002684092],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009721572,"about_ca_system_score_gemma":0.002722812,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007525443,"about_ca_topic_score_gemma":0.01784433,"domain_scores_codex":[0.9975433,0.0005386423,0.0002133294,0.0006825143,0.000885337,0.0001368453],"domain_scores_gemma":[0.9926179,0.002355898,0.0005972918,0.001512151,0.002605289,0.0003114649],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005584256,0.0002902588,0.01321367,0.0005368675,0.00009751396,0.0003894474,0.001643865,0.02907878,0.02802926,0.04666984,0.02175761,0.8577344],"study_design_scores_gemma":[0.0001018156,0.0002989096,0.0200992,0.0002525951,0.0001998596,0.001479971,0.001526156,0.5393065,0.05295849,0.1644429,0.2191298,0.0002038736],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06129764,0.0007969602,0.9139946,0.0004613895,0.0002100967,0.0005105436,0.006611234,0.004411623,0.01170585],"genre_scores_gemma":[0.1955242,0.0004649581,0.7836925,0.0001287568,0.0001433165,0.0005707522,0.01135367,0.0008909656,0.007230924],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007525443,"threshold_uncertainty_score":0.01615477,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}