{"meta":{"query_hash":"627b644e1b00","filters":{"venue":"Journal of Data Mining & Digital Humanities"},"cohort_total":6,"direct_labels_cover":0,"predictions_cover":6,"exported":6,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/627b644e1b00","api":"https://metacan.xera.ac/api/v1/cohort?venue=Journal+of+Data+Mining+%26+Digital+Humanities"},"results":[{"id":"W2802812759","doi":"10.46298/jdmdh.4457","title":"Prosopographical data analysis. Application to the Angevin officers (XIII–XV centuries)","year":2018,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Medieval European Literature and History","field":"Arts and Humanities","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Moncton","funders":"Agence Nationale de la Recherche","keywords":"Prosopography; Relation (database); Online analytical processing; History; Visualization; Classics; Data science; Computer science; Database; Data warehouse; Data mining","score_opus":0.10256588130227359,"score_gpt":0.2855709712024714,"score_spread":0.1830050899001978,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2802812759","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6250687,0.0014753878,0.0689223,0.0009018512,0.00025657425,0.0011263022,0.20099168,0.002772752,0.09848444],"genre_scores_gemma":[0.7564513,0.0012643051,0.15661465,0.00007479762,0.00012405236,0.0024191737,0.06506408,0.00052085536,0.017466722],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.99966073,0.00008278203,0.00004011118,0.00008878988,0.000090075686,0.000037393973],"domain_scores_gemma":[0.9979838,0.00092081545,0.0003309149,0.00029212915,0.000347527,0.00012474558],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009228631,0.00031859704,0.00018392202,0.0094179,0.00088604336,0.001356347,0.0003703398,0.00031919597,0.01298999],"category_scores_gemma":[0.003676629,0.00018467766,0.00022806092,0.012972731,0.000443675,0.00078655814,0.0013846187,0.00046586693,0.0021630803],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055083504,0.00020843235,0.23256208,0.0017938877,0.00013615491,0.0023504167,0.044943307,0.00434846,0.00897697,0.034053016,0.05139667,0.6186798],"study_design_scores_gemma":[0.000045836052,0.00010219397,0.4524474,0.00047185653,0.000066040935,0.0012639012,0.034463346,0.0117250085,0.007054798,0.011958633,0.4803299,0.00007110082],"about_ca_topic_score_codex":0.008215651,"about_ca_topic_score_gemma":0.015383323,"teacher_disagreement_score":0.01298999,"about_ca_system_score_codex":0.0004301321,"about_ca_system_score_gemma":0.0006636154,"threshold_uncertainty_score":0.0434559},"labels":[],"label_agreement":null},{"id":"W3125727712","doi":"10.46298/jdmdh.21","title":"Deception in Speeches of Candidates for Public Office","year":2015,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Media Influence and Politics","field":"Social Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Royal Military College of Canada; Queen's University","funders":"","keywords":"Deception; Persona; Subconscious; Perception; Psychology; Presidential system; Skepticism; Social psychology; Perspective (graphical); Politics; Cognitive psychology; Computer science; Political science; Epistemology; Artificial intelligence; Human–computer interaction; Law; Philosophy","score_opus":0.3966178400552383,"score_gpt":0.39901415041545907,"score_spread":0.0023963103602207547,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3125727712","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.972235,0.0013644765,0.007427953,0.002473221,0.00052650174,0.00006066309,0.0010633046,0.00006896571,0.014779793],"genre_scores_gemma":[0.9925175,0.000398351,0.0018705633,0.00030211912,0.00033837397,0.000046799123,0.0006066876,0.000037023907,0.0038826268],"study_design_codex":"observational","study_design_gemma":"observational","domain_scores_codex":[0.9941618,0.0031605493,0.000540877,0.0004992829,0.0013554299,0.00028209077],"domain_scores_gemma":[0.91119796,0.060380712,0.017835556,0.004334404,0.0052628815,0.0009885055],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004607094,0.00033383624,0.0003832854,0.0017294334,0.0012340271,0.002808438,0.00045345665,0.001306343,0.003947326],"category_scores_gemma":[0.07143185,0.0002165201,0.000227593,0.0014899693,0.0009824529,0.0020117671,0.0015156188,0.0015869484,0.0014692352],"study_design_candidate":"observational","study_design_consensus":"observational","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004299632,0.0006452367,0.36314845,0.001738342,0.0005071181,0.004045389,0.21333356,0.0037678094,0.036074966,0.034490164,0.023576323,0.314373],"study_design_scores_gemma":[0.000071700844,0.00066868844,0.75903505,0.0010057464,0.0002496429,0.0026805352,0.063293524,0.02427828,0.018259017,0.020309884,0.10971985,0.00042816022],"about_ca_topic_score_codex":0.0017174386,"about_ca_topic_score_gemma":0.0021954128,"teacher_disagreement_score":0.004607094,"about_ca_system_score_codex":0.0007924659,"about_ca_system_score_gemma":0.00032841077,"threshold_uncertainty_score":0.024364948},"labels":[],"label_agreement":null},{"id":"W4225331178","doi":"10.46298/jdmdh.9123","title":"Towards an empirical evaluation of translated texts and translation quality","year":2022,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Trois-Rivières","funders":"","keywords":"Computer science; Machine translation; Natural language processing; Phraseology; Source text; Artificial intelligence; Context (archaeology); Quality (philosophy); Translation (biology); Linguistics","score_opus":0.27107377730309534,"score_gpt":0.42736644358020137,"score_spread":0.15629266627710603,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4225331178","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.22599944,0.0058187605,0.72107846,0.002609718,0.00031377643,0.0018129195,0.0028019608,0.0012525057,0.03831253],"genre_scores_gemma":[0.7347958,0.0014892467,0.2532876,0.0004437496,0.00033594927,0.0025817603,0.0037205047,0.0007277898,0.0026177107],"study_design_codex":"design_other","study_design_gemma":"observational","domain_scores_codex":[0.8055444,0.13004248,0.013150205,0.011194759,0.038832694,0.0012354836],"domain_scores_gemma":[0.5494729,0.2975434,0.041035395,0.04148311,0.06808916,0.002375958],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.109679185,0.001648914,0.0015835079,0.011617981,0.0012953657,0.008555014,0.0026761284,0.0025513822,0.006669734],"category_scores_gemma":[0.4075953,0.0007758859,0.0010642126,0.013370885,0.007156247,0.010449621,0.0066799615,0.0024493656,0.0021832567],"study_design_candidate":"observational","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012612636,0.0015612151,0.2139689,0.0056436285,0.001402917,0.00050243555,0.02055697,0.018458698,0.010378568,0.10493266,0.013430724,0.60790193],"study_design_scores_gemma":[0.0005740297,0.0035060982,0.4276375,0.0058784396,0.001383713,0.0015901731,0.02112822,0.16878796,0.038400542,0.23025712,0.1001939,0.0006623501],"about_ca_topic_score_codex":0.0015031133,"about_ca_topic_score_gemma":0.0009654546,"teacher_disagreement_score":0.109679185,"about_ca_system_score_codex":0.0023214922,"about_ca_system_score_gemma":0.0027661393,"threshold_uncertainty_score":0.58004594},"labels":[],"label_agreement":null},{"id":"W4392910228","doi":"10.46298/jdmdh.10403","title":"Exploring Data Provenance in Handwritten Text Recognition Infrastructure: Sharing and Reusing Ground Truth Data, Referencing Models, and Acknowledging Contributions. Starting the Conversation on How We Could Get It Done","year":2024,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Research Data Management Practices","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"Nederlandse Organisatie voor Wetenschappelijk Onderzoek","keywords":"Conversation; Ground truth; Reuse; Provenance; Computer science; Natural language processing; Artificial intelligence; Linguistics; Engineering; Geology; Philosophy","score_opus":0.5182855834595688,"score_gpt":0.37307797120339903,"score_spread":0.14520761225616974,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4392910228","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0865043,0.0034683808,0.823488,0.04668201,0.0013303177,0.0010436138,0.0015807212,0.0030380846,0.032864533],"genre_scores_gemma":[0.404315,0.0018363512,0.57420063,0.0024838203,0.0004473657,0.00068499026,0.0022076895,0.0019095613,0.011914639],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.90466595,0.060239732,0.00799027,0.009406211,0.015525852,0.00217196],"domain_scores_gemma":[0.6136292,0.14414969,0.023503026,0.16814853,0.04616965,0.0043998663],"candidate_categories":["metaresearch","open_science"],"consensus_categories":[],"category_scores_codex":[0.120847456,0.0009528724,0.00094808056,0.008774965,0.0086155115,0.020513415,0.005146106,0.00443366,0.003964064],"category_scores_gemma":[0.30701336,0.0015569074,0.0013493879,0.010212457,0.014942145,0.05838966,0.023885356,0.0061014933,0.0022122767],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00049015257,0.0002618553,0.027646128,0.0016391817,0.00017988456,0.0017486023,0.22301404,0.005844741,0.008992393,0.23355556,0.014880234,0.48174724],"study_design_scores_gemma":[0.00006180987,0.00025757993,0.0067766136,0.0037211261,0.00019609444,0.0013245973,0.0804686,0.014170013,0.022742769,0.46809325,0.40180603,0.00038151367],"about_ca_topic_score_codex":0.0087339785,"about_ca_topic_score_gemma":0.012338199,"teacher_disagreement_score":0.9948539,"about_ca_system_score_codex":0.0056089037,"about_ca_system_score_gemma":0.015210375,"threshold_uncertainty_score":0.6391101},"labels":[],"label_agreement":null},{"id":"W4394803700","doi":"10.46298/jdmdh.10542","title":"The Challenges of HTR Model Training: Feedback from the Project Donner le gout de l'archive a l'ere numerique","year":2023,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Mathematics, Computing, and Information Processing","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Rimouski; Université de Montréal","funders":"Social Sciences and Humanities Research Council of Canada; Université de Montréal; Université de Sherbrooke; Université du Québec à Rimouski","keywords":"Training (meteorology); Gout; Psychology; Computer science; Physical medicine and rehabilitation; Medicine; Physics; Internal medicine; Meteorology","score_opus":0.1937526202284116,"score_gpt":0.3030778760184903,"score_spread":0.10932525579007868,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4394803700","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.55348027,0.009655227,0.27747148,0.07768201,0.0035242795,0.0012770889,0.0059048613,0.010438535,0.060566194],"genre_scores_gemma":[0.73499227,0.004416643,0.20438132,0.0057978705,0.0007883044,0.0006786363,0.01068632,0.004282117,0.033976562],"study_design_codex":"design_other","study_design_gemma":"qualitative","domain_scores_codex":[0.9609237,0.02109456,0.0015015668,0.0033548786,0.01216963,0.0009556477],"domain_scores_gemma":[0.764484,0.16336028,0.0027807658,0.009714476,0.05442378,0.0052366345],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.054887783,0.0018146511,0.0012673567,0.0014365106,0.0024411306,0.00455283,0.0033016158,0.0039659566,0.004898823],"category_scores_gemma":[0.21986164,0.0006168705,0.0007748522,0.0014335798,0.002688622,0.00611901,0.004392203,0.00496253,0.003665967],"study_design_candidate":"qualitative","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0013452992,0.002293376,0.025127482,0.0020256266,0.00016740587,0.0016807173,0.047060106,0.045324117,0.015980497,0.007673424,0.18389633,0.6674256],"study_design_scores_gemma":[0.00031163494,0.0021428724,0.027215354,0.0018285913,0.00015980302,0.002350607,0.04741642,0.21363074,0.039762795,0.014141873,0.6505331,0.00050623034],"about_ca_topic_score_codex":0.020240985,"about_ca_topic_score_gemma":0.024623958,"teacher_disagreement_score":0.054887783,"about_ca_system_score_codex":0.0031157355,"about_ca_system_score_gemma":0.0044130203,"threshold_uncertainty_score":0.29027784},"labels":[],"label_agreement":null},{"id":"W4402821732","doi":"10.46298/jdmdh.12520","title":"Temporal Sequencing of Documents","year":2024,"lang":"en","type":"article","venue":"Journal of Data Mining & Digital Humanities","topic":"Semantic Web and Ontologies","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Computational biology; Information retrieval; Biology","score_opus":0.1301717141655876,"score_gpt":0.31885139752208425,"score_spread":0.18867968335649665,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4402821732","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061297644,0.0007969602,0.91399455,0.0004613895,0.00021009674,0.00051054364,0.0066112336,0.004411623,0.011705852],"genre_scores_gemma":[0.19552419,0.00046495805,0.78369254,0.00012875684,0.00014331653,0.0005707522,0.011353671,0.0008909656,0.007230924],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99754333,0.0005386423,0.00021332937,0.00068251434,0.000885337,0.00013684534],"domain_scores_gemma":[0.9926179,0.0023558983,0.0005972918,0.001512151,0.0026052895,0.00031146486],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015877306,0.00064531487,0.00062780705,0.0047929445,0.0013207487,0.0019788407,0.0010586729,0.0004989595,0.004829048],"category_scores_gemma":[0.013405388,0.0005462496,0.0006463157,0.0056251204,0.0005215108,0.002426075,0.0012983456,0.0012322577,0.002684092],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00055842556,0.0002902588,0.013213673,0.0005368675,0.000097513956,0.00038944738,0.0016438651,0.029078778,0.028029256,0.04666984,0.021757612,0.8577344],"study_design_scores_gemma":[0.0001018156,0.00029890955,0.0200992,0.00025259514,0.00019985961,0.0014799715,0.0015261559,0.53930646,0.05295849,0.1644429,0.21912979,0.0002038736],"about_ca_topic_score_codex":0.0075254426,"about_ca_topic_score_gemma":0.017844327,"teacher_disagreement_score":0.0075254426,"about_ca_system_score_codex":0.00097215717,"about_ca_system_score_gemma":0.0027228117,"threshold_uncertainty_score":0.016154766},"labels":[],"label_agreement":null}]}