{"meta":{"query_hash":"b933c51cc8d0","filters":{"venue":"Journal Of Big Data"},"cohort_total":29,"direct_labels_cover":0,"predictions_cover":29,"exported":29,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/b933c51cc8d0","api":"https://metacan.xera.ac/api/v1/cohort?venue=Journal+Of+Big+Data"},"results":[{"id":"W1623534659","doi":"10.1186/s40537-015-0021-4","title":"Meta-MapReduce for scalable data mining","year":2015,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa; Dalhousie University","funders":"","keywords":"Computer science; Scalability; Big data; AdaBoost; Machine learning; Node (physics); Programming paradigm; Cloud computing; Artificial intelligence; Data mining; Database; Programming language; Operating system; Support vector machine","score_opus":0.6436468009513665,"score_gpt":0.3948568341215879,"score_spread":0.2487899668297786,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1623534659","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010142759,0.0015450434,0.9531105,0.0011904113,0.00037305852,0.00050134247,0.0024286716,0.024009056,0.0066991355],"genre_scores_gemma":[0.19125973,0.0011272038,0.7933522,0.00050106685,0.00023026436,0.0008690856,0.0069934195,0.0014166132,0.0042503527],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979462,0.0004733485,0.00019103536,0.00042678812,0.00078158994,0.00018103655],"domain_scores_gemma":[0.998181,0.0004029113,0.00009125242,0.0007890814,0.0003950501,0.00014076229],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026771852,0.0011987305,0.0011372312,0.0015185312,0.0011665517,0.001913957,0.0036853729,0.0006839767,0.0031743753],"category_scores_gemma":[0.0038910655,0.0008916737,0.0025629678,0.0025962156,0.0006093958,0.0025300377,0.0028191376,0.0018287541,0.002094832],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009826651,0.0006255988,0.005034094,0.0014149223,0.0010167544,0.00072993024,0.00054393464,0.16730657,0.022738867,0.07372227,0.16308837,0.5627959],"study_design_scores_gemma":[0.00019645412,0.0001296876,0.0017442689,0.00007122055,0.000085514635,0.0004104926,0.00023446558,0.78923273,0.015689554,0.124069355,0.06805522,0.000081015074],"about_ca_topic_score_codex":0.004964501,"about_ca_topic_score_gemma":0.0060887286,"teacher_disagreement_score":0.004964501,"about_ca_system_score_codex":0.0010348817,"about_ca_system_score_gemma":0.0025776927,"threshold_uncertainty_score":0.014158487},"labels":[],"label_agreement":null},{"id":"W2132987460","doi":"10.1186/s40537-014-0011-y","title":"Contextual anomaly detection framework for big sensor data","year":2015,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":141,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Western University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Anomaly detection; Context (archaeology); Toolbox; Data mining; Detector; Cluster analysis; Task (project management); False positive paradox; Anomaly (physics); Volume (thermodynamics); Big data; Process (computing); Content (measure theory); Artificial intelligence; Machine learning; Pattern recognition (psychology)","score_opus":0.2992592294446529,"score_gpt":0.3639286034466015,"score_spread":0.06466937400194861,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2132987460","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0026570011,0.0002966749,0.9932903,0.00014054336,0.000048526683,0.00006793653,0.0002854776,0.002754059,0.0004593838],"genre_scores_gemma":[0.19615303,0.00051613245,0.7993755,0.0002238052,0.00022112332,0.00028860886,0.0016240807,0.00032833323,0.001269414],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99794704,0.00037492652,0.0001433225,0.00047340468,0.00091365125,0.00014766994],"domain_scores_gemma":[0.9978415,0.0006730731,0.00026910487,0.0003895077,0.0007005615,0.0001263293],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024778116,0.0011248576,0.0013015753,0.0031005384,0.00074241945,0.0019327234,0.0029641802,0.0010498127,0.0014314164],"category_scores_gemma":[0.0068101147,0.00043220172,0.0014413135,0.0023652203,0.00075568963,0.0021083911,0.0022327823,0.0019023718,0.0006145571],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00041637564,0.00041234537,0.011424246,0.0006550093,0.00054250023,0.0007695776,0.00054582255,0.39876622,0.014724746,0.10413959,0.020050544,0.447553],"study_design_scores_gemma":[0.00001293809,0.000041185565,0.000972289,0.000018194753,0.000036358164,0.00014132388,0.00006426867,0.9535026,0.0028016751,0.034650277,0.007732538,0.000026257327],"about_ca_topic_score_codex":0.008479136,"about_ca_topic_score_gemma":0.011398731,"teacher_disagreement_score":0.008479136,"about_ca_system_score_codex":0.0011635221,"about_ca_system_score_gemma":0.0019335441,"threshold_uncertainty_score":0.016859591},"labels":[],"label_agreement":null},{"id":"W2772611570","doi":"10.1186/s40537-017-0106-3","title":"A computing platform for pairs-trading online implementation via a blended Kalman-HMM filtering approach","year":2017,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Complex Systems and Time Series Analysis","field":"Economics, Econometrics and Finance","cited_by":14,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University; TD Bank Group","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Trading strategy; Kalman filter; Hidden Markov model; Pairs trade; Algorithmic trading; Analytics; High-frequency trading; Big data; Herding; Algorithm; Machine learning; Data mining; Artificial intelligence; Econometrics; Finance; Economics","score_opus":0.27014718466711596,"score_gpt":0.3335862340197416,"score_spread":0.06343904935262562,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2772611570","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002986575,0.00003624115,0.99259627,0.000059097,0.00003078132,0.000033356613,0.00002701079,0.0028277861,0.001402892],"genre_scores_gemma":[0.2709111,0.00011939653,0.7230574,0.00013538072,0.00005853709,0.00025106277,0.00024928246,0.00035636537,0.004861479],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99917185,0.00013999124,0.00007002917,0.00025162616,0.00027384577,0.00009269601],"domain_scores_gemma":[0.9990921,0.0002659551,0.00005247751,0.00033937278,0.0001752035,0.00007486293],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000942642,0.0006066204,0.0007535424,0.0006033815,0.00071322924,0.0015018407,0.001983994,0.0011035505,0.008423064],"category_scores_gemma":[0.002843648,0.0005453858,0.0007259695,0.00048124886,0.0006291236,0.002213242,0.0019955235,0.0013473501,0.0034685307],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0007495907,0.0004026395,0.002631149,0.00017489838,0.00014949682,0.00043192296,0.000536577,0.27054107,0.038003933,0.06747063,0.006377433,0.6125306],"study_design_scores_gemma":[0.000024287176,0.00006587631,0.00021854896,0.000014171557,0.000019892836,0.000051807998,0.000035946327,0.97029006,0.008121744,0.014715074,0.0064189457,0.00002360117],"about_ca_topic_score_codex":0.0035101555,"about_ca_topic_score_gemma":0.0034060164,"teacher_disagreement_score":0.008423064,"about_ca_system_score_codex":0.0005930487,"about_ca_system_score_gemma":0.0009767319,"threshold_uncertainty_score":0.028177917},"labels":[],"label_agreement":null},{"id":"W2806417635","doi":"10.1186/s40537-018-0128-5","title":"A non-parametric maximum for number of selected features: objective optima for FDR and significance threshold with application to ordinal survey analysis","year":2018,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Advanced Statistical Methods and Models","field":"Mathematics","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Capilano University; Simon Fraser University","funders":"","keywords":"False discovery rate; Statistical hypothesis testing; Mathematics; False positives and false negatives; Statistics; Multiple comparisons problem; Parametric statistics; Ordinal data; False positive paradox; Computer science; Nonparametric statistics; Set (abstract data type); Data mining; Artificial intelligence; Pattern recognition (psychology)","score_opus":0.16021114342389361,"score_gpt":0.44617616919924197,"score_spread":0.2859650257753483,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2806417635","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0048626023,0.00039083883,0.99347585,0.00034496078,0.000039586455,0.00012824863,0.00006349966,0.00021536839,0.00047915836],"genre_scores_gemma":[0.10996707,0.00022729303,0.8878526,0.00017939832,0.00008462483,0.0008357398,0.00011879814,0.00017109625,0.00056347036],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.94866776,0.03846556,0.0020718614,0.0036381634,0.006159208,0.0009975386],"domain_scores_gemma":[0.7826437,0.18900582,0.006815595,0.00933656,0.011093141,0.0011051493],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.07064896,0.0014927072,0.0029247287,0.0034979428,0.001634517,0.0028208096,0.0039715962,0.0033187163,0.0018800014],"category_scores_gemma":[0.22329673,0.0008263541,0.0022516511,0.003162873,0.0032928796,0.0035676195,0.0042999717,0.0043769474,0.00051844603],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002443468,0.00047923866,0.02249555,0.002703512,0.00095247466,0.0012011678,0.0018041057,0.18834487,0.015397013,0.20094806,0.006706838,0.5565237],"study_design_scores_gemma":[0.00025575256,0.0009772968,0.0067532654,0.000536715,0.0003156867,0.001297343,0.000512055,0.75372773,0.01291115,0.21335784,0.009149825,0.00020535232],"about_ca_topic_score_codex":0.0009663551,"about_ca_topic_score_gemma":0.00084150414,"teacher_disagreement_score":0.07064896,"about_ca_system_score_codex":0.0018565039,"about_ca_system_score_gemma":0.003139942,"threshold_uncertainty_score":0.3736319},"labels":[],"label_agreement":null},{"id":"W2947950257","doi":"10.1186/s40537-019-0203-6","title":"Detecting taxi movements using Random Swap clustering and sequential pattern mining","year":2019,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Data Management and Algorithms","field":"Computer Science","cited_by":19,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Carleton University","keywords":"Cluster analysis; Computer science; Swap (finance); Silhouette; Data mining; Hierarchical clustering; k-means clustering; Artificial intelligence","score_opus":0.11508057947702388,"score_gpt":0.29573302343564384,"score_spread":0.18065244395861996,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2947950257","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.26713526,0.00036257057,0.7183812,0.0003543238,0.000100033205,0.000425864,0.0030625986,0.0067595616,0.0034185674],"genre_scores_gemma":[0.59528756,0.00018656414,0.39819852,0.0000635523,0.000032794822,0.00021242525,0.004375211,0.00014603743,0.001497307],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991874,0.0001162518,0.000075009506,0.00027819464,0.00024782037,0.00009522343],"domain_scores_gemma":[0.9989956,0.00020813942,0.00016151324,0.00016584765,0.00040526857,0.000063649524],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006399604,0.0008251789,0.000699029,0.0044836295,0.0006652285,0.0007451881,0.0009909585,0.00055530627,0.00085331034],"category_scores_gemma":[0.0022506178,0.00032904383,0.00085627544,0.0036179738,0.00031330952,0.0008793217,0.00072284706,0.0003913816,0.00059487927],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00076958496,0.0005236405,0.075676255,0.00042320168,0.0004913834,0.00074659794,0.00065819937,0.2105328,0.020930847,0.005384438,0.013932288,0.66993076],"study_design_scores_gemma":[0.000020671401,0.00007303961,0.012482034,0.000015566298,0.000045679004,0.00022705852,0.00024946444,0.97462964,0.0065736254,0.0027841064,0.0028696496,0.000029454635],"about_ca_topic_score_codex":0.021043578,"about_ca_topic_score_gemma":0.027066119,"teacher_disagreement_score":0.021043578,"about_ca_system_score_codex":0.0006673876,"about_ca_system_score_gemma":0.0010115997,"threshold_uncertainty_score":0.041842163},"labels":[],"label_agreement":null},{"id":"W2952066860","doi":"10.1186/s40537-019-0218-z","title":"STVG: an evolutionary graph framework for analyzing fast-evolving networks","year":2019,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Transportation Planning and Optimization","field":"Social Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"Natural Sciences and Engineering Research Council of Canada; Tertiary Education Trust Fund; Cisco Systems","keywords":"Computer science; Theoretical computer science; Graph; Snapshot (computer storage); Graph database; Database","score_opus":0.0752406044275541,"score_gpt":0.3422732496091298,"score_spread":0.2670326451815757,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2952066860","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0066523757,0.0002024908,0.9908421,0.00010014858,0.000026891768,0.000035992478,0.0005400156,0.0009688389,0.00063118263],"genre_scores_gemma":[0.2696203,0.0010472191,0.7212587,0.0001757198,0.00009711345,0.00036482041,0.004250867,0.0007641038,0.0024211644],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9996412,0.00011897982,0.000019787842,0.00010594988,0.000081324506,0.00003279355],"domain_scores_gemma":[0.99887806,0.0005934698,0.00016302586,0.00014246882,0.00015700742,0.0000659085],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008572858,0.0012237867,0.00091078994,0.0038141496,0.0006578251,0.0012875716,0.0015952673,0.0009446727,0.0023159746],"category_scores_gemma":[0.0036537347,0.00050720584,0.0014327802,0.0030543169,0.00077843934,0.0016793725,0.0011526286,0.0012214908,0.00046196592],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000038549282,0.000046269197,0.0035468584,0.00015828175,0.00016151783,0.00020226637,0.00019259886,0.86972463,0.0033099507,0.058030427,0.0039508734,0.060637806],"study_design_scores_gemma":[0.0000038008081,0.000012415798,0.0004377016,0.000010445433,0.000012463084,0.000041837793,0.00003653928,0.9650011,0.00032292254,0.031657226,0.0024534096,0.000010183011],"about_ca_topic_score_codex":0.012011338,"about_ca_topic_score_gemma":0.013713881,"teacher_disagreement_score":0.012011338,"about_ca_system_score_codex":0.0009891018,"about_ca_system_score_gemma":0.0009505226,"threshold_uncertainty_score":0.023882866},"labels":[],"label_agreement":null},{"id":"W3022470673","doi":"10.1186/s40537-020-00302-z","title":"Leveraging machine learning and big data for optimizing medication prescriptions in complex diseases: a case study in diabetes management","year":2020,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Diabetes, Cardiovascular Risks, and Lipoproteins","field":"Medicine","cited_by":24,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McMaster University; Toronto Metropolitan University","funders":"","keywords":"Computer science; Bayesian network; Big data; Machine learning; Medical prescription; Variable (mathematics); Artificial intelligence; Bayesian probability; Data mining; Medicine; Mathematics","score_opus":0.2050337070575335,"score_gpt":0.3363276992871178,"score_spread":0.13129399222958432,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3022470673","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6112227,0.0014139533,0.37747112,0.005253794,0.00007716327,0.00029637475,0.0003068743,0.00027518673,0.0036829163],"genre_scores_gemma":[0.84953916,0.00026349246,0.14922664,0.00017322514,0.00003731943,0.000093793125,0.00011206859,0.00001929824,0.0005349681],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99845004,0.001012413,0.00008043316,0.00016819581,0.00018402575,0.00010481862],"domain_scores_gemma":[0.99158365,0.007183243,0.00041531297,0.00024696699,0.00030382033,0.00026717354],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004402338,0.0006552637,0.00089416356,0.0009856279,0.00069808733,0.0013253739,0.0008824201,0.0017086016,0.00093373045],"category_scores_gemma":[0.009459522,0.0004535978,0.0008328418,0.001260987,0.0007586219,0.0010890098,0.0011100253,0.0013542874,0.00008284554],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027626695,0.0005834468,0.025482938,0.00011824193,0.00014304505,0.0010030551,0.00019548586,0.88504004,0.0008458607,0.007900987,0.0012132768,0.0771973],"study_design_scores_gemma":[0.000052465723,0.00007797935,0.0016593052,0.00001269903,0.000022875636,0.000105620325,0.00007410264,0.9926117,0.0005695024,0.00422907,0.00057162344,0.000013035934],"about_ca_topic_score_codex":0.009634621,"about_ca_topic_score_gemma":0.009759998,"teacher_disagreement_score":0.009634621,"about_ca_system_score_codex":0.0012577514,"about_ca_system_score_gemma":0.002011255,"threshold_uncertainty_score":0.023282051},"labels":[],"label_agreement":null},{"id":"W3044719873","doi":"10.1186/s40537-020-00329-2","title":"Predictive big data analytics for supply chain demand forecasting: methods, applications, and research opportunities","year":2020,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Forecasting Techniques and Applications","field":"Decision Sciences","cited_by":469,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Supply chain; Computer science; Predictive analytics; Demand forecasting; Supply chain management; Big data; Time series; Data science; Cluster analysis; Analytics; Support vector machine; Data mining; Machine learning; Operations research; Business; Engineering; Marketing","score_opus":0.9012087118397553,"score_gpt":0.5583508521736629,"score_spread":0.3428578596660924,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3044719873","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04915968,0.15329814,0.756181,0.021171456,0.0012115821,0.00027170987,0.0018730065,0.0012641137,0.015569267],"genre_scores_gemma":[0.6757975,0.13627456,0.18036811,0.0010956802,0.0020698537,0.00027820645,0.0019852573,0.00009819834,0.0020326057],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99846125,0.0006353348,0.00008908437,0.00021666783,0.0005157207,0.00008198944],"domain_scores_gemma":[0.9874177,0.009620682,0.00051401666,0.0006923856,0.0015468429,0.0002083578],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004293393,0.0011011919,0.0010570417,0.0033049753,0.00042604358,0.003043124,0.0013391766,0.0011693905,0.0014494219],"category_scores_gemma":[0.0104520125,0.0004934039,0.000843969,0.007935752,0.0008571466,0.0033670045,0.0011798954,0.0024343948,0.00065566227],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00017390405,0.00033353246,0.02329741,0.0020846575,0.00032196927,0.00018768663,0.000389112,0.13302803,0.0013759172,0.07835561,0.01882362,0.74162847],"study_design_scores_gemma":[0.000022948147,0.00008381852,0.0038509741,0.0010086079,0.000076376535,0.00011159587,0.00063288765,0.83657545,0.0014607529,0.13162367,0.024493806,0.000059124835],"about_ca_topic_score_codex":0.0038528885,"about_ca_topic_score_gemma":0.0025027643,"teacher_disagreement_score":0.004293393,"about_ca_system_score_codex":0.0008396555,"about_ca_system_score_gemma":0.00133517,"threshold_uncertainty_score":0.022705913},"labels":[],"label_agreement":null},{"id":"W3081491601","doi":"10.1186/s40537-020-00345-2","title":"Prediction of probable backorder scenarios in the supply chain using Distributed Random Forest and Gradient Boosting Machine learning techniques","year":2020,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Forecasting Techniques and Applications","field":"Decision Sciences","cited_by":160,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Toronto Metropolitan University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Gradient boosting; Random forest; Computer science; Boosting (machine learning); Decision tree; Machine learning; CLARITY; Artificial intelligence; Flexibility (engineering); Metric (unit); Supply chain; Tree (set theory); Business process; Process (computing); Data mining; Work in process; Statistics; Mathematics; Operations management; Engineering","score_opus":0.30504179187817343,"score_gpt":0.3606107987158744,"score_spread":0.055569006837700996,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3081491601","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6890613,0.00031967476,0.30769292,0.00030116693,0.000045245444,0.000080431666,0.00047203703,0.0007054317,0.0013218006],"genre_scores_gemma":[0.9639474,0.000052531497,0.03519288,0.000018042349,0.000008742767,0.000022654209,0.00038142054,0.000010594762,0.00036560593],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99940884,0.0002099896,0.000036504505,0.00011477634,0.0001317482,0.000098214616],"domain_scores_gemma":[0.99726933,0.0016650432,0.00028844146,0.00012609188,0.00049450604,0.00015659558],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0017953158,0.0006654324,0.0006991246,0.0012879334,0.00039690064,0.000665325,0.00068162766,0.0007349612,0.0009134432],"category_scores_gemma":[0.003434895,0.00031393714,0.00083613937,0.0007902755,0.00022953296,0.0006932856,0.00029674114,0.0007922367,0.00022687674],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00005510084,0.00005151646,0.0048322347,0.000015763186,0.000013566172,0.000065650136,0.0000114198765,0.9838436,0.0004437724,0.00030176464,0.00016761872,0.0101980185],"study_design_scores_gemma":[0.0000010376508,0.000009845351,0.0005038902,0.0000015085958,0.0000014043687,0.000003918721,0.0000037608709,0.9990792,0.00013338895,0.00024287244,0.000017485447,0.0000016368735],"about_ca_topic_score_codex":0.01227912,"about_ca_topic_score_gemma":0.010589991,"teacher_disagreement_score":0.01227912,"about_ca_system_score_codex":0.0008692655,"about_ca_system_score_gemma":0.00079538993,"threshold_uncertainty_score":0.024415314},"labels":[],"label_agreement":null},{"id":"W3081799531","doi":"10.1186/s40537-020-00333-6","title":"Short-term stock market price trend prediction using a comprehensive deep learning system","year":2020,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Stock Market Forecasting Methods","field":"Decision Sciences","cited_by":370,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada; Carleton University","keywords":"Feature engineering; Computer science; Stock market; Stock (firearms); Artificial intelligence; Deep learning; Machine learning; Big data; Personalization; Stock market prediction; Econometrics; Data mining; Economics; World Wide Web","score_opus":0.4401202832170943,"score_gpt":0.4249298837676808,"score_spread":0.015190399449413472,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3081799531","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.63913697,0.0006510237,0.3425198,0.00060391624,0.00018014303,0.00016521051,0.001874359,0.010086479,0.004782127],"genre_scores_gemma":[0.9198969,0.00017655878,0.074705385,0.0001732287,0.000058056292,0.00006740591,0.0023080572,0.000040105224,0.0025743719],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99975365,0.000016156899,0.000026214231,0.00008524873,0.00008470955,0.00003402142],"domain_scores_gemma":[0.9995486,0.000072446106,0.000050327315,0.00006292145,0.00022707597,0.000038622708],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00052500906,0.0006627903,0.00065206626,0.0009503668,0.00033336744,0.0007135563,0.00075018744,0.00047288617,0.0011877335],"category_scores_gemma":[0.0010980216,0.00034929422,0.00041857077,0.00075176294,0.00013740573,0.0015722691,0.00068210356,0.0006697959,0.00049981894],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00051918195,0.0011745614,0.025204722,0.00013044747,0.00026153153,0.00036420062,0.00011069106,0.24300557,0.04035639,0.0017558404,0.009061211,0.6780557],"study_design_scores_gemma":[0.000009157707,0.00006343954,0.0020579363,0.0000033572192,0.000019939096,0.000017534614,0.0000055934524,0.9945269,0.002509523,0.00038201152,0.00039544472,0.000009080706],"about_ca_topic_score_codex":0.010531849,"about_ca_topic_score_gemma":0.014398642,"teacher_disagreement_score":0.010531849,"about_ca_system_score_codex":0.00067486643,"about_ca_system_score_gemma":0.0009620471,"threshold_uncertainty_score":0.020941079},"labels":[],"label_agreement":null},{"id":"W3124386847","doi":"10.1186/s40537-021-00418-w","title":"CaReAl: capturing read alignments in a BAM file rapidly and conveniently","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Genomics and Phylogenetic Studies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Princess Margaret Cancer Centre; University Health Network","funders":"National Institute of Food and Drug Safety Evaluation; Ministry of Food and Drug Safety","keywords":"Computer science; Snapshot (computer storage); Visualization; Multithreading; Data mining; Database; Operating system; Thread (computing)","score_opus":0.053662873558947666,"score_gpt":0.26752129902605437,"score_spread":0.2138584254671067,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3124386847","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025454786,0.0006899859,0.57819057,0.0004439808,0.00044533183,0.00072769425,0.031997733,0.35686305,0.0051868735],"genre_scores_gemma":[0.0891458,0.00050424854,0.8436969,0.00063154934,0.00014615622,0.001345505,0.031819973,0.027044306,0.0056655006],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9983347,0.00030600614,0.00017446333,0.0004960835,0.00052694825,0.00016179722],"domain_scores_gemma":[0.9952251,0.002094631,0.0005169916,0.0009290535,0.0009204347,0.00031382617],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026542472,0.0024227304,0.0008762137,0.0035162151,0.00084953784,0.0022583522,0.00240295,0.0009601822,0.01887442],"category_scores_gemma":[0.008849668,0.00092914497,0.0008615281,0.0022899462,0.00044764768,0.0021275117,0.0018124068,0.0019743773,0.008550096],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0032118277,0.0002549949,0.007137129,0.0025305022,0.0003098794,0.0011004639,0.0012031702,0.002307074,0.2816453,0.0050596073,0.22155574,0.47368437],"study_design_scores_gemma":[0.0003907975,0.00042066467,0.0210196,0.00053984474,0.00017508175,0.001512982,0.0005023857,0.060232446,0.6427234,0.0071239662,0.26476106,0.000597866],"about_ca_topic_score_codex":0.0018830424,"about_ca_topic_score_gemma":0.0029024044,"teacher_disagreement_score":0.01887442,"about_ca_system_score_codex":0.00059081905,"about_ca_system_score_gemma":0.0009052908,"threshold_uncertainty_score":0.06314117},"labels":[],"label_agreement":null},{"id":"W3155713909","doi":"10.1186/s40537-021-00455-5","title":"Domain randomization for neural network classification","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"York University","funders":"Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada; Natural Sciences and Engineering Research Council of Canada; Canada Research Chairs","keywords":"Computer science; Classifier (UML); Convolutional neural network; Artificial intelligence; Artificial neural network; Task (project management); Domain (mathematical analysis); Machine learning; Pattern recognition (psychology); Randomization; Transfer of learning; Contextual image classification; Data mining; Image (mathematics); Clinical trial; Mathematics","score_opus":0.1690613487970136,"score_gpt":0.3181836121059016,"score_spread":0.14912226330888803,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3155713909","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04178901,0.0013293845,0.9510252,0.0006740045,0.00016915044,0.00013055834,0.0005122534,0.002135514,0.0022349537],"genre_scores_gemma":[0.65922904,0.0008071466,0.33284378,0.00060101174,0.00019432108,0.00060355745,0.0021153314,0.00034732049,0.0032584784],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9988701,0.0005213528,0.000060334627,0.00031264988,0.00016847356,0.000067009554],"domain_scores_gemma":[0.9967043,0.0017842018,0.00024132377,0.0009003299,0.00027632783,0.00009349998],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0027524685,0.0007010297,0.0008125714,0.0005964385,0.00045456804,0.0008933873,0.001345253,0.0011444085,0.0021942202],"category_scores_gemma":[0.011886481,0.00039772558,0.0007602952,0.00069410104,0.0011059574,0.0018049671,0.0013432052,0.0024441457,0.00093182013],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042146337,0.0002286327,0.0034967728,0.00027615542,0.00013626645,0.00014659883,0.00009652542,0.7257523,0.009950066,0.043512296,0.009505554,0.20647742],"study_design_scores_gemma":[0.000012720586,0.000041149622,0.00033140084,0.0000149588395,0.0000057164953,0.000036512876,0.000011709168,0.96647936,0.0023719333,0.029086115,0.0015976911,0.000010605221],"about_ca_topic_score_codex":0.001582684,"about_ca_topic_score_gemma":0.0014848956,"teacher_disagreement_score":0.0027524685,"about_ca_system_score_codex":0.0010105044,"about_ca_system_score_gemma":0.0008148433,"threshold_uncertainty_score":0.014556587},"labels":[],"label_agreement":null},{"id":"W3162192441","doi":"10.1186/s40537-021-00539-2","title":"Integration of image segmentation and fuzzy theory to improve the accuracy of damage detection areas in traffic accidents","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Industrial Vision Systems and Defect Detection","field":"Engineering","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Machine vision; Computer science; Process (computing); Field (mathematics); Artificial intelligence; Fuzzy logic; Segmentation; Image processing; Computer vision; Machine learning; Image (mathematics)","score_opus":0.04525610434908552,"score_gpt":0.29229943292188365,"score_spread":0.24704332857279812,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3162192441","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.32512993,0.0010472089,0.6692139,0.00023864977,0.00016551766,0.00008513638,0.0000898316,0.0014894552,0.0025404827],"genre_scores_gemma":[0.8577056,0.00024998182,0.14090987,0.00005809611,0.000051691663,0.000025447227,0.00008999998,0.000039772214,0.00086954556],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99956685,0.00006039071,0.000033725806,0.00009907329,0.00018298381,0.000056984125],"domain_scores_gemma":[0.9990471,0.00030957133,0.00007593393,0.00005938064,0.00046601752,0.000041960942],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008057868,0.00043472517,0.0006597306,0.0025702128,0.00035345243,0.0006157485,0.0005735357,0.0007598378,0.00087132456],"category_scores_gemma":[0.0017476295,0.00031373248,0.0006040354,0.00086492667,0.0003340451,0.00074499956,0.00031828677,0.00041688455,0.00020661407],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00084384746,0.00045566176,0.013690497,0.0002675852,0.0001862017,0.00025320664,0.00023097321,0.15531722,0.09444103,0.0021103977,0.0021237673,0.73007965],"study_design_scores_gemma":[0.000013155065,0.00011156891,0.005401545,0.0000110757,0.000054161737,0.00008217268,0.000042476044,0.97610134,0.017117407,0.0005431433,0.00050541834,0.000016478478],"about_ca_topic_score_codex":0.00731994,"about_ca_topic_score_gemma":0.007129501,"teacher_disagreement_score":0.00731994,"about_ca_system_score_codex":0.00058023713,"about_ca_system_score_gemma":0.0006725807,"threshold_uncertainty_score":0.01455462},"labels":[],"label_agreement":null},{"id":"W3169194364","doi":"10.1186/s40537-021-00504-z","title":"The LRA Workbench: an IDE for efficient REST API composition through linked metadata","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Service-Oriented Architecture and Web Services","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Athabasca University; University of Alberta","funders":"","keywords":"Computer science; Workbench; Algorithm; Metadata; Database; Data mining; World Wide Web","score_opus":0.11870621425021255,"score_gpt":0.32371307929150894,"score_spread":0.2050068650412964,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3169194364","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.002527451,0.000089091336,0.82874626,0.0001364802,0.00010674812,0.00046432638,0.0008687371,0.16280359,0.0042573647],"genre_scores_gemma":[0.04525626,0.000352917,0.8604525,0.0006079203,0.00014023377,0.0020026837,0.00693554,0.06852409,0.015727807],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9958832,0.0012275,0.0005609479,0.0005931742,0.0013970776,0.00033812894],"domain_scores_gemma":[0.99276465,0.003553611,0.0005296483,0.0018220794,0.00079612975,0.0005339154],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009286385,0.0029207075,0.0014108125,0.0028986186,0.0011699136,0.005014786,0.0048548803,0.0018036058,0.023601012],"category_scores_gemma":[0.010942296,0.0021814632,0.0032725113,0.0008420055,0.0015816212,0.006086885,0.006168857,0.004817613,0.018464979],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00242702,0.0020969014,0.0061607417,0.0017803386,0.00070793414,0.003901012,0.002449355,0.02516067,0.10066517,0.10170677,0.18199073,0.5709534],"study_design_scores_gemma":[0.0011742236,0.0005023938,0.0020098723,0.0007706443,0.00021738234,0.0011919677,0.0004211419,0.40295115,0.13878855,0.04171003,0.40972477,0.00053785054],"about_ca_topic_score_codex":0.0022789638,"about_ca_topic_score_gemma":0.0023602545,"teacher_disagreement_score":0.023601012,"about_ca_system_score_codex":0.0011497983,"about_ca_system_score_gemma":0.001968123,"threshold_uncertainty_score":0.078953266},"labels":[],"label_agreement":null},{"id":"W3181834696","doi":"10.1186/s40537-021-00489-9","title":"Examining the impact of cross-domain learning on crime prediction","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Crime Patterns and Interventions","field":"Social Sciences","cited_by":18,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"Memorial University of Newfoundland; Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada; Memorial University of Newfoundland; Dalhousie University","keywords":"Computer science; Generalization; Perspective (graphical); Domain (mathematical analysis); Transfer of learning; Data science; Domain knowledge; Task (project management); Machine learning; Baseline (sea); Crime analysis; Demographics; Artificial intelligence; Subject-matter expert; Data mining; Expert system","score_opus":0.34207003076943,"score_gpt":0.4718022365358112,"score_spread":0.12973220576638123,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3181834696","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.91434,0.002274659,0.07557656,0.0013000509,0.00021665686,0.00019356445,0.0008694561,0.0007940718,0.0044349344],"genre_scores_gemma":[0.9796139,0.0002351379,0.017985305,0.00013949473,0.000045928853,0.00004400823,0.0013721327,0.000029509485,0.0005346472],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99472,0.0031266923,0.00023945842,0.0011117043,0.000457438,0.00034475303],"domain_scores_gemma":[0.9734823,0.01941883,0.0010001308,0.0029542886,0.0024468976,0.0006975499],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.017164832,0.0016601052,0.0010515688,0.0021121437,0.00092347927,0.0018849766,0.0013310588,0.0016415102,0.001176273],"category_scores_gemma":[0.027617257,0.00038752067,0.0011501581,0.0020582988,0.00086465105,0.0036549151,0.0028741278,0.0026231583,0.00040895707],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012932529,0.0021657292,0.1753616,0.00021567293,0.0010473446,0.00018545681,0.00031276402,0.63263255,0.0012294364,0.0016512728,0.0037090818,0.18019587],"study_design_scores_gemma":[0.000023208637,0.00025736098,0.011041727,0.000028033432,0.00008562422,0.00003643975,0.00022530404,0.98484784,0.0012248127,0.0017202852,0.00048838096,0.000021031483],"about_ca_topic_score_codex":0.02413159,"about_ca_topic_score_gemma":0.01609326,"teacher_disagreement_score":0.02413159,"about_ca_system_score_codex":0.0015580368,"about_ca_system_score_gemma":0.0017402478,"threshold_uncertainty_score":0.09077734},"labels":[],"label_agreement":null},{"id":"W4200412035","doi":"10.1186/s40537-021-00547-2","title":"Dynamic order Markov model for categorical sequence clustering","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Algorithms and Data Compression","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"Natural Sciences and Engineering Research Council of Canada; National Natural Science Foundation of China","keywords":"Computer science; Hidden Markov model; Cluster analysis; Pattern recognition (psychology); Markov chain; Markov model; Sequence (biology); Categorical variable; Suffix tree; Data mining; Artificial intelligence; Algorithm; Data structure; Machine learning","score_opus":0.13437511965790933,"score_gpt":0.3358048966184071,"score_spread":0.2014297769604978,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4200412035","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012558269,0.00043491475,0.9834715,0.00036340757,0.000056595054,0.00008828669,0.00065981917,0.000537543,0.0018296464],"genre_scores_gemma":[0.64599186,0.0014845912,0.3329063,0.0004724401,0.00022216454,0.00088418863,0.004150235,0.00023998288,0.013648258],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9985197,0.0003150997,0.00008644565,0.0005578768,0.00035496667,0.00016597193],"domain_scores_gemma":[0.9977367,0.0012656514,0.00029502474,0.000250079,0.00035103015,0.000101554026],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014156443,0.00076474954,0.0014654832,0.0016997511,0.0009260456,0.0012666362,0.0033406836,0.0017356293,0.004077865],"category_scores_gemma":[0.004908535,0.0005168018,0.0015038155,0.0025589387,0.0011050001,0.0023327996,0.0012770401,0.0020983068,0.0014004828],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0001252697,0.00007909784,0.0039426247,0.00017255248,0.00008611458,0.0002608136,0.0003930384,0.74494857,0.0027386337,0.18090917,0.0037333183,0.06261088],"study_design_scores_gemma":[0.00000511762,0.000011370731,0.00021460827,0.0000058569476,0.000008022006,0.00004007436,0.000013008453,0.9643211,0.00017573845,0.034030024,0.0011630725,0.000012007411],"about_ca_topic_score_codex":0.016214117,"about_ca_topic_score_gemma":0.016365523,"teacher_disagreement_score":0.016214117,"about_ca_system_score_codex":0.0022096206,"about_ca_system_score_gemma":0.0020094707,"threshold_uncertainty_score":0.032239497},"labels":[],"label_agreement":null},{"id":"W4210862833","doi":"10.1186/s40537-021-00468-0","title":"Big data quality framework: a holistic approach to continuous quality management","year":2021,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":141,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Big data; Computer science; Data quality; Profiling (computer programming); Data science; Data mining; Quality (philosophy); Data management; Exploratory data analysis; Engineering; Operations management","score_opus":0.7948772270531455,"score_gpt":0.5341265486844159,"score_spread":0.26075067836872956,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4210862833","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0032238683,0.0010459239,0.9877215,0.002229395,0.00011614661,0.00032573377,0.00020408505,0.0007506341,0.004382772],"genre_scores_gemma":[0.16086186,0.0013659871,0.834285,0.0005096621,0.00028606717,0.00052272703,0.0007481945,0.00016239168,0.0012581208],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9801129,0.0071782186,0.002191905,0.0023361307,0.0071777464,0.0010030885],"domain_scores_gemma":[0.9840884,0.0040163067,0.0023513925,0.0024618073,0.0056607393,0.0014212142],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.023199674,0.0016357228,0.0014600258,0.008474006,0.0017299454,0.012490123,0.0051376685,0.0022821692,0.0014913738],"category_scores_gemma":[0.017044382,0.0009524018,0.0026351681,0.0069205747,0.004829486,0.009860926,0.007141108,0.004336807,0.00044414282],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000109313274,0.00026213477,0.007876138,0.0010750912,0.00028378214,0.0005295757,0.0018074961,0.085427634,0.0028134235,0.7666662,0.008924868,0.1242244],"study_design_scores_gemma":[0.000048177077,0.00023702215,0.0030710134,0.0011476688,0.00023051696,0.0004890858,0.0016006741,0.5202304,0.003794894,0.40367115,0.06530437,0.00017502705],"about_ca_topic_score_codex":0.008350067,"about_ca_topic_score_gemma":0.0044308635,"teacher_disagreement_score":0.023199674,"about_ca_system_score_codex":0.0046137967,"about_ca_system_score_gemma":0.008362233,"threshold_uncertainty_score":0.12269306},"labels":[],"label_agreement":null},{"id":"W4302614395","doi":"10.1186/s40537-022-00608-0","title":"Adaptive multiple imputations of missing values using the class center","year":2022,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"Thailand Research Fund; Natural Sciences and Engineering Research Council of Canada; Khon Kaen University","keywords":"Imputation (statistics); Missing data; Categorical variable; Computer science; Data mining; Artificial intelligence; Machine learning","score_opus":0.19522271418559686,"score_gpt":0.33417412123125606,"score_spread":0.1389514070456592,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4302614395","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.017183691,0.0004366473,0.9798456,0.00018976547,0.00012355436,0.00010953589,0.00020389038,0.0014124522,0.0004948528],"genre_scores_gemma":[0.32314548,0.0003264682,0.6731293,0.00024622923,0.00019924444,0.00031362998,0.0012547814,0.00025599406,0.001128894],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9922104,0.0034319737,0.0004648808,0.0019964112,0.001531445,0.00036489885],"domain_scores_gemma":[0.9765385,0.010851828,0.0024089578,0.0049863355,0.004696288,0.0005181684],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.011393767,0.0010427659,0.0023542058,0.0024612292,0.0014411117,0.0015378892,0.004029055,0.0014574614,0.0021795346],"category_scores_gemma":[0.026362704,0.0005064394,0.0022733829,0.0030634168,0.0009679542,0.0019625756,0.0019139297,0.002583719,0.00078852585],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017836969,0.00069213036,0.028491167,0.00050950074,0.0009569022,0.00048705257,0.00072631554,0.1839453,0.006714864,0.02013231,0.014357018,0.7412037],"study_design_scores_gemma":[0.00008864654,0.00015867273,0.0033539387,0.00006567504,0.0001467606,0.0002173655,0.00014064276,0.9649383,0.009794086,0.01596033,0.0050566783,0.00007893913],"about_ca_topic_score_codex":0.0043479395,"about_ca_topic_score_gemma":0.0032909706,"teacher_disagreement_score":0.011393767,"about_ca_system_score_codex":0.0009786697,"about_ca_system_score_gemma":0.0025983935,"threshold_uncertainty_score":0.06025672},"labels":[],"label_agreement":null},{"id":"W4311824268","doi":"10.1186/s40537-022-00667-3","title":"Chromatin state distribution of residue-specific histone acetylation in early myoblast differentiation","year":2022,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Genomics and Chromatin Dynamics","field":"Biochemistry, Genetics and Molecular Biology","cited_by":4,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada; Southeast University","keywords":"Epigenetics; Chromatin; Histone; Histone acetyltransferase; Acetylation; Computational biology; Biology; Regulation of gene expression; Histone Acetyltransferases; Histone methyltransferase; Cell biology; Genetics; Gene","score_opus":0.025726578740153612,"score_gpt":0.2479546704509838,"score_spread":0.2222280917108302,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4311824268","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9846656,0.00089798775,0.0102135725,0.00003676837,0.00000846414,0.000013114868,0.0029622647,0.00012073176,0.001081578],"genre_scores_gemma":[0.99307317,0.0002483702,0.003255453,0.000033403652,0.0000049010764,0.000014488334,0.0028644176,0.000027863309,0.00047805533],"study_design_codex":"bench_or_experimental","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9998548,0.000018766728,0.000010361758,0.0000639058,0.000034166987,0.00001792637],"domain_scores_gemma":[0.9997032,0.00010715484,0.00006620394,0.000042447562,0.000054727145,0.00002621526],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00034655762,0.00007779725,0.00019266973,0.00045689303,0.00014798698,0.00037555333,0.00012562612,0.0001337734,0.0009389437],"category_scores_gemma":[0.0005566693,0.0001251968,0.00012300642,0.0005809706,0.00018036735,0.00017684021,0.0002026236,0.00019934481,0.00023161994],"study_design_candidate":"bench_or_experimental","study_design_consensus":"bench_or_experimental","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003708183,0.000021565922,0.07783725,0.00012544519,0.000058979633,0.00004977394,0.0002607391,0.0012518027,0.90019715,0.0006180815,0.00021133064,0.018996982],"study_design_scores_gemma":[0.0000070477563,0.00006855115,0.85356593,0.000016861779,0.00004563831,0.0001774612,0.00014395965,0.006384821,0.13690335,0.000722857,0.0019398186,0.000023677158],"about_ca_topic_score_codex":0.0010953523,"about_ca_topic_score_gemma":0.003596508,"teacher_disagreement_score":0.0010953523,"about_ca_system_score_codex":0.00022221584,"about_ca_system_score_gemma":0.0001348762,"threshold_uncertainty_score":0.0031411052},"labels":[],"label_agreement":null},{"id":"W4324378562","doi":"10.1186/s40537-023-00710-x","title":"A semi-supervised short text sentiment classification method based on improved Bert model from unlabelled data","year":2023,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Sentiment Analysis and Opinion Mining","field":"Computer Science","cited_by":30,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"","keywords":"Computer science; Bottleneck; Sentiment analysis; Artificial intelligence; Semi-supervised learning; Machine learning; Big data; Supervised learning; Language model; Function (biology); Natural language processing; Data mining; Artificial neural network","score_opus":0.2707046506402733,"score_gpt":0.37505771781517383,"score_spread":0.1043530671749005,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4324378562","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.14525922,0.0006761482,0.8440723,0.00066956045,0.0003192094,0.00025846148,0.0005136308,0.0036159216,0.0046155127],"genre_scores_gemma":[0.8554309,0.00035954767,0.12950148,0.0004128112,0.00029505196,0.00032563784,0.0024866501,0.0001778676,0.0110100005],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9994112,0.00009987212,0.00004396329,0.00017269031,0.00019020044,0.00008214654],"domain_scores_gemma":[0.9992041,0.00017924147,0.000068843125,0.000071048635,0.0004241559,0.00005256534],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00096342806,0.0010571536,0.00095850544,0.0011729643,0.00060588884,0.00080974895,0.0017874517,0.0009995655,0.0022271136],"category_scores_gemma":[0.001627171,0.00038874647,0.0009008281,0.00070970255,0.00039292383,0.0015838176,0.00071886333,0.0010350178,0.0011780838],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0008885717,0.0005879161,0.008885298,0.00020207227,0.00015217328,0.00033863014,0.000261733,0.23255147,0.032029625,0.0037315523,0.013462832,0.70690805],"study_design_scores_gemma":[0.000005994061,0.000026422938,0.0003550702,0.0000033078431,0.0000074905765,0.000014056503,0.000009585263,0.9974112,0.0014531016,0.00041740554,0.0002907176,0.000005699204],"about_ca_topic_score_codex":0.0063932897,"about_ca_topic_score_gemma":0.0074463394,"teacher_disagreement_score":0.0063932897,"about_ca_system_score_codex":0.00079424697,"about_ca_system_score_gemma":0.00088634394,"threshold_uncertainty_score":0.012712121},"labels":[],"label_agreement":null},{"id":"W4360827072","doi":"10.1186/s40537-023-00711-w","title":"Deep learning based deep-sea automatic image enhancement and animal species classification","year":2023,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Ichthyology and Marine Biology","field":"Environmental Science","cited_by":41,"is_retracted":false,"has_abstract":true,"route_ca_aff":false,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":true,"ca_institutions":"","funders":"Centro para el Desarrollo Tecnológico Industrial; Ministerio de Ciencia, Innovación y Universidades","keywords":"Computer science; Artificial intelligence; Residual; Deep learning; Pipeline (software); Pattern recognition (psychology); Data set; Set (abstract data type); Convolutional neural network; Algorithm","score_opus":0.06251843455730097,"score_gpt":0.2822145933443102,"score_spread":0.21969615878700924,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4360827072","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.28474712,0.00093405787,0.6994057,0.0003462416,0.00014726738,0.00016081397,0.00078059646,0.009109602,0.0043687033],"genre_scores_gemma":[0.75786686,0.00032490495,0.23203775,0.00022660378,0.000036837715,0.00008429012,0.0014722423,0.00016436874,0.007786071],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9997795,0.000027119071,0.000011529704,0.000052809723,0.00006568705,0.00006335076],"domain_scores_gemma":[0.99970394,0.000061983104,0.000041682677,0.000044936583,0.00012850291,0.000018920695],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005757501,0.0007864629,0.00046637486,0.00082456344,0.00016030199,0.00043235754,0.00072308443,0.00055966555,0.0017836255],"category_scores_gemma":[0.00068569323,0.00023468207,0.00061078847,0.00046097662,0.0002589651,0.0005360699,0.00058548164,0.00067541335,0.0008670218],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00043607983,0.00034410125,0.005137005,0.00017452802,0.00014621062,0.00018536113,0.00008441008,0.123805836,0.14837317,0.0012348515,0.00483715,0.71524125],"study_design_scores_gemma":[0.000008311487,0.00010272654,0.0027513,0.000013225396,0.00002382595,0.00004934013,0.000017480015,0.94625944,0.048991226,0.00046490153,0.0013051692,0.000013095347],"about_ca_topic_score_codex":0.004357764,"about_ca_topic_score_gemma":0.0054844036,"teacher_disagreement_score":0.004357764,"about_ca_system_score_codex":0.00041777312,"about_ca_system_score_gemma":0.00043973373,"threshold_uncertainty_score":0.008664787},"labels":[],"label_agreement":null},{"id":"W4384821779","doi":"10.1186/s40537-023-00796-3","title":"Detecting bots in social-networks using node and structural embeddings","year":2023,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Spam and Phishing Detection","field":"Computer Science","cited_by":32,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Broadcom (Canada); Toronto Metropolitan University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Metadata; Embedding; Class (philosophy); Node (physics); Machine learning; Social network (sociolinguistics); Feature (linguistics); Artificial intelligence; Anonymity; Focus (optics); Information retrieval; Data mining; Social media; World Wide Web","score_opus":0.1361918284243414,"score_gpt":0.33335033520205176,"score_spread":0.19715850677771035,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4384821779","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.85739994,0.0005491958,0.13660762,0.0005825138,0.00004917138,0.000098732235,0.0014397672,0.00067810284,0.0025949348],"genre_scores_gemma":[0.98505485,0.000105973624,0.0136020025,0.000021412128,0.000024907864,0.00002134389,0.0006790835,0.000017457329,0.00047304117],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99937963,0.00022027535,0.00004471582,0.00014688651,0.00012935138,0.00007909301],"domain_scores_gemma":[0.99393046,0.0033726227,0.0014266215,0.00051257474,0.00049697916,0.00026084407],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007925448,0.0005837838,0.0004677115,0.003542539,0.00037591028,0.0010206515,0.00038764384,0.00085574365,0.0010890025],"category_scores_gemma":[0.006232741,0.00023489694,0.0004294149,0.0017636737,0.0006800059,0.0025949937,0.0009898961,0.0007611448,0.00058214297],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00079523324,0.0006794914,0.45860758,0.0005744977,0.00040044065,0.00082390674,0.0014939441,0.2396473,0.016058031,0.020597149,0.006581163,0.25374123],"study_design_scores_gemma":[0.0000067981687,0.00009175419,0.026709279,0.00004914959,0.00002681205,0.00022701066,0.0004573604,0.9550988,0.0022503354,0.013862599,0.0011961401,0.000023943341],"about_ca_topic_score_codex":0.0021696866,"about_ca_topic_score_gemma":0.0032336893,"teacher_disagreement_score":0.003542539,"about_ca_system_score_codex":0.0004725935,"about_ca_system_score_gemma":0.00028271196,"threshold_uncertainty_score":0.004314065},"labels":[],"label_agreement":null},{"id":"W4390759017","doi":"10.1186/s40537-023-00866-6","title":"RPf-GCNs: reciprocal perspective driven fused GCNs for rumor detection on social media","year":2024,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Misinformation and Its Impacts","field":"Social Sciences","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Institute for Information and Communications Technology Promotion; Ministry of Science and ICT, South Korea; National Research Foundation of Korea; National Research Foundation","keywords":"Reciprocal; Computer science; Rumor; Perspective (graphical); Graph; Social media; Convolutional neural network; Profiling (computer programming); Artificial intelligence; Machine learning; Data science; World Wide Web; Theoretical computer science","score_opus":0.29748346181366003,"score_gpt":0.42489555319564437,"score_spread":0.12741209138198434,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4390759017","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.2535589,0.0036966924,0.72411186,0.0012016131,0.00038753494,0.00021947654,0.001459486,0.007455118,0.007909257],"genre_scores_gemma":[0.8982186,0.0005401096,0.0953486,0.00032580915,0.00010906934,0.000059247566,0.0013144097,0.000094730814,0.00398933],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99968386,0.000060701917,0.000014191352,0.00009199124,0.000084065476,0.00006525881],"domain_scores_gemma":[0.9993197,0.00023892202,0.00008102412,0.00008690936,0.0002283324,0.000045088498],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005727379,0.001026083,0.00059460546,0.0011069145,0.0004427797,0.0006699561,0.0013410961,0.0012497922,0.0012279336],"category_scores_gemma":[0.0026399624,0.0002663661,0.0006000189,0.00072464684,0.00043543315,0.001415976,0.0008380001,0.0013443449,0.00043680007],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00053781236,0.0003084861,0.009306054,0.00019601596,0.00024107983,0.00038273967,0.0002525705,0.3943212,0.015230802,0.0060204533,0.009140045,0.5640627],"study_design_scores_gemma":[0.0000044541116,0.00003112365,0.0006935883,0.000012163371,0.000018695086,0.000036637146,0.000028863815,0.9941816,0.0022567587,0.002186219,0.00054192095,0.000008032211],"about_ca_topic_score_codex":0.021557264,"about_ca_topic_score_gemma":0.025808228,"teacher_disagreement_score":0.021557264,"about_ca_system_score_codex":0.0009326373,"about_ca_system_score_gemma":0.00084159395,"threshold_uncertainty_score":0.042863607},"labels":[],"label_agreement":null},{"id":"W4391520039","doi":"10.1186/s40537-023-00842-0","title":"Survey of transformers and towards ensemble learning using transformers for natural language processing","year":2024,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Topic Modeling","field":"Computer Science","cited_by":112,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Carleton University","funders":"Natural Sciences and Engineering Research Council of Canada; Carleton University","keywords":"Computer science; Transformer; Automatic summarization; Artificial intelligence; Language model; Question answering; Natural language processing; Classifier (UML); Natural language; Machine learning; Sentiment analysis; Natural language understanding; Ensemble forecasting","score_opus":0.14319068897057724,"score_gpt":0.35099681994531884,"score_spread":0.2078061309747416,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391520039","genre_codex":"methods","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011972409,0.025399938,0.9537063,0.0012633934,0.00029971782,0.00010042384,0.00029666224,0.0022790593,0.004682138],"genre_scores_gemma":[0.5181679,0.07933551,0.3833855,0.0017671611,0.0013417915,0.00046601315,0.0036895997,0.0007853341,0.011061164],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.99861073,0.00046816992,0.00011388969,0.000364155,0.0003644769,0.00007852579],"domain_scores_gemma":[0.99714535,0.0016530094,0.00010031082,0.00045887838,0.0005463647,0.00009612323],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028671818,0.0016224958,0.00129751,0.0023993156,0.0004586726,0.0018718132,0.0020855037,0.00087849103,0.002567156],"category_scores_gemma":[0.0066964403,0.00067364395,0.0017425225,0.0031415455,0.00072564714,0.00590084,0.0019836607,0.0023347295,0.0014128287],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019183078,0.00021065756,0.0042485613,0.0007025637,0.0003189522,0.00010122721,0.00022056668,0.10667882,0.0026685824,0.056333028,0.01414452,0.81418073],"study_design_scores_gemma":[0.000015040808,0.00021639015,0.0008394908,0.00011344636,0.000116112096,0.00017610054,0.0000831174,0.90625215,0.0027611686,0.071310304,0.01807844,0.0000382828],"about_ca_topic_score_codex":0.005278216,"about_ca_topic_score_gemma":0.0038880797,"teacher_disagreement_score":0.005278216,"about_ca_system_score_codex":0.0011853713,"about_ca_system_score_gemma":0.0015017656,"threshold_uncertainty_score":0.015163243},"labels":[],"label_agreement":null},{"id":"W4393112045","doi":"10.1186/s40537-024-00898-6","title":"Multi-sample $$\\zeta $$-mixup: richer, more realistic synthetic samples from a p-series interpolant","year":2024,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Natural Sciences and Engineering Research Council of Canada; Alliance de recherche numérique du Canada; Compute Canada; Simon Fraser University; Nvidia","keywords":"Algorithm; Computer science; Machine learning; Artificial intelligence; Series (stratigraphy)","score_opus":0.18171046952873535,"score_gpt":0.33451089087990676,"score_spread":0.15280042135117142,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4393112045","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.15421394,0.00026475126,0.8348506,0.0009682633,0.00019425686,0.00010368956,0.00072454935,0.0026600328,0.006019993],"genre_scores_gemma":[0.7311571,0.00009029359,0.26201275,0.00042869762,0.000053286072,0.00015771257,0.0015963102,0.0006129006,0.0038909377],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99904305,0.0003276104,0.000047731875,0.00020639834,0.00028707462,0.000088110246],"domain_scores_gemma":[0.9962978,0.0020745168,0.00022710265,0.0006389547,0.00047843176,0.0002832485],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0029291597,0.0012648538,0.0008412404,0.0006604522,0.00055677834,0.0013365046,0.0014319337,0.0016490285,0.005790364],"category_scores_gemma":[0.009177419,0.00044933773,0.0009997445,0.00054139586,0.0013845995,0.0017385829,0.0024213663,0.0027556522,0.0008733049],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010011207,0.00030029265,0.00375371,0.00022675333,0.000092176815,0.00041299165,0.00017472163,0.85881394,0.011218164,0.048018828,0.008416055,0.067571245],"study_design_scores_gemma":[0.000017213531,0.000036747668,0.00010874733,0.000009150447,0.0000027107778,0.00002546454,0.000011342879,0.9904185,0.0033219117,0.0053460817,0.00069456524,0.000007672692],"about_ca_topic_score_codex":0.0021291818,"about_ca_topic_score_gemma":0.002129819,"teacher_disagreement_score":0.005790364,"about_ca_system_score_codex":0.00080458797,"about_ca_system_score_gemma":0.00072849845,"threshold_uncertainty_score":0.019370675},"labels":[],"label_agreement":null},{"id":"W4409069510","doi":"10.1186/s40537-025-01122-9","title":"SPINEX-anomaly: similarity-based predictions with explainable neighbors exploration for anomaly and outlier detection","year":2025,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Manitoba","funders":"Clemson University","keywords":"Anomaly detection; Anomaly (physics); Outlier; Computer science; Similarity (geometry); Data mining; Computational Science and Engineering; Artificial intelligence; Pattern recognition (psychology); Machine learning; Image (mathematics)","score_opus":0.06406157203631375,"score_gpt":0.29009704088610744,"score_spread":0.2260354688497937,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4409069510","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.059167504,0.0006511876,0.9318586,0.00046626927,0.00010750889,0.00017099483,0.0005094618,0.0060474044,0.0010209921],"genre_scores_gemma":[0.6202494,0.00026181745,0.37520182,0.00025891454,0.00013196233,0.0002227988,0.0018079304,0.00029018839,0.0015751509],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984182,0.000372341,0.00009774135,0.00039139687,0.0005928412,0.00012746101],"domain_scores_gemma":[0.9962633,0.0019131134,0.00044241763,0.0005493287,0.0006588022,0.00017299822],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001965711,0.0014201489,0.0016314308,0.0020950064,0.00071810745,0.0013735514,0.0026681216,0.0011728242,0.001568],"category_scores_gemma":[0.009443905,0.00040683636,0.0010960648,0.0017176651,0.00091730914,0.002439733,0.0027753226,0.0021851137,0.0006450041],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00069144147,0.00041619816,0.027201824,0.00027839976,0.00035015124,0.0004400358,0.0005039947,0.42502925,0.007817154,0.014258313,0.012531334,0.51048195],"study_design_scores_gemma":[0.000018938299,0.000077311706,0.00056917104,0.000008653948,0.000012227252,0.00007599459,0.000042477124,0.99064714,0.0014360325,0.0062457398,0.00085515284,0.000011023797],"about_ca_topic_score_codex":0.0041027046,"about_ca_topic_score_gemma":0.004192894,"teacher_disagreement_score":0.0041027046,"about_ca_system_score_codex":0.00068842305,"about_ca_system_score_gemma":0.0016923517,"threshold_uncertainty_score":0.010395825},"labels":[],"label_agreement":null},{"id":"W4410234140","doi":"10.1186/s40537-025-01141-6","title":"FunDa: scalable serverless data analytics and in situ query processing","year":2025,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Cloud Computing and Resource Management","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of New Brunswick","funders":"Natural Sciences and Engineering Research Council of Canada; Mitacs; New Brunswick Innovation Foundation","keywords":"Computer science; Scalability; Analytics; Database; SQL; Data science","score_opus":0.10645358447112441,"score_gpt":0.30749756790749044,"score_spread":0.20104398343636604,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4410234140","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.070715524,0.0019202046,0.6408348,0.0016738629,0.0006128639,0.0011936917,0.0042386004,0.2652336,0.013576805],"genre_scores_gemma":[0.6097093,0.00088146835,0.36011907,0.0014881769,0.00039903517,0.0006596484,0.012001525,0.0048271543,0.009914629],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9963858,0.0004109697,0.00023961868,0.0007817883,0.0017037453,0.0004781465],"domain_scores_gemma":[0.99464005,0.0008405583,0.0003923884,0.0024638395,0.000910667,0.0007526478],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0026077032,0.0018009816,0.0014423185,0.002146227,0.0011258154,0.0037016263,0.0054463837,0.0012353666,0.004602379],"category_scores_gemma":[0.007601105,0.0009810929,0.001022244,0.0020796778,0.0013140874,0.0066492776,0.0064746514,0.00250075,0.0031294075],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004148815,0.001984215,0.02025909,0.0011805001,0.0008927575,0.0012615836,0.0013408264,0.032039158,0.08568019,0.031958394,0.27272797,0.5465266],"study_design_scores_gemma":[0.0006539915,0.0006110699,0.007178829,0.000120564844,0.00017070446,0.001072526,0.00039904108,0.8201731,0.045087412,0.026776059,0.097422175,0.00033458602],"about_ca_topic_score_codex":0.0073562195,"about_ca_topic_score_gemma":0.004619215,"teacher_disagreement_score":0.0073562195,"about_ca_system_score_codex":0.0012230078,"about_ca_system_score_gemma":0.0026814102,"threshold_uncertainty_score":0.015396476},"labels":[],"label_agreement":null},{"id":"W4415383695","doi":"10.1186/s40537-025-01280-w","title":"Digital twins in healthcare: a review of AI-powered practical applications across health domains","year":2025,"lang":"en","type":"review","venue":"Journal Of Big Data","topic":"Digital Transformation in Industry","field":"Engineering","cited_by":10,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Calgary","funders":"","keywords":"Health care; Digital health; Mental healthcare; Selection (genetic algorithm); Mental health; Virtual patient","score_opus":0.16700421305543162,"score_gpt":0.4465265295323191,"score_spread":0.27952231647688747,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4415383695","genre_codex":"review","genre_gemma":"review","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"review","genre_consensus":"review","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00016955913,0.996842,0.00042724083,0.0005413766,0.00013177525,0.000015839767,0.000023436107,0.000009627309,0.0018391248],"genre_scores_gemma":[0.001492041,0.99727255,0.0006030484,0.0002642412,0.00009674066,0.000017318891,0.000025336964,0.0000040236746,0.00022456162],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9988011,0.00039493947,0.00021776324,0.00014552202,0.0003784394,0.00006227227],"domain_scores_gemma":[0.99320775,0.0056474134,0.00029157105,0.00012934388,0.0006127497,0.00011118136],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002737951,0.00079346704,0.0012652418,0.004526147,0.0004928156,0.0020273572,0.00091807195,0.0014779367,0.0055578914],"category_scores_gemma":[0.0065665506,0.000447482,0.0010667554,0.0049563083,0.00093319645,0.0022996902,0.0015474468,0.0015701738,0.0015033631],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000042890595,0.000060935938,0.00030435272,0.049482472,0.00013640734,0.00012351085,0.00028891923,0.0005135898,0.00048697754,0.013393493,0.011513608,0.9236529],"study_design_scores_gemma":[0.000016105834,0.00013096718,0.0011605467,0.05036,0.0002728851,0.00078075414,0.00037109663,0.00025699878,0.0005646045,0.0063719866,0.9396661,0.00004803089],"about_ca_topic_score_codex":0.0020188084,"about_ca_topic_score_gemma":0.002746893,"teacher_disagreement_score":0.0055578914,"about_ca_system_score_codex":0.0010069002,"about_ca_system_score_gemma":0.0027490635,"threshold_uncertainty_score":0.018593013},"labels":[],"label_agreement":null},{"id":"W4416285692","doi":"10.1186/s40537-025-01307-2","title":"UniqueNOSD: a novel framework for NoSQL over SQL databases","year":2025,"lang":"en","type":"article","venue":"Journal Of Big Data","topic":"Advanced Database Systems and Queries","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"Natural Sciences and Engineering Research Council of Canada; University of Windsor","keywords":"NoSQL; SQL; Scalability; Relational database; Relational database management system; Redundancy (engineering); Consistency (knowledge bases); View; Query by Example","score_opus":0.1547059754666002,"score_gpt":0.37866323701805993,"score_spread":0.22395726155145973,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4416285692","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0035547176,0.0010925046,0.9321506,0.0007908146,0.0006082603,0.0006480769,0.0032774666,0.05198342,0.0058940444],"genre_scores_gemma":[0.10331229,0.0017171226,0.8634985,0.0014376921,0.0005670653,0.001483666,0.013333925,0.005351747,0.009297982],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9960912,0.00062036904,0.0006467776,0.0005323749,0.0018143427,0.00029484142],"domain_scores_gemma":[0.99701357,0.00079039705,0.00022899105,0.0010259389,0.0007229253,0.00021810153],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0055143526,0.0009923521,0.0013159654,0.0018324964,0.0010831774,0.0048559215,0.005019292,0.0010760896,0.010841073],"category_scores_gemma":[0.009844989,0.001022452,0.0014791539,0.0024959191,0.0014032718,0.005651874,0.00554741,0.0029902847,0.0032251794],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011274235,0.00052513933,0.0058067455,0.0024549302,0.00039496276,0.0010473484,0.0006259618,0.025114318,0.01682076,0.28884187,0.2013106,0.45592996],"study_design_scores_gemma":[0.00044806418,0.00029720174,0.00089501933,0.00038991528,0.00017690458,0.00094272604,0.0002133612,0.32063252,0.024190797,0.15125342,0.5002908,0.00026935973],"about_ca_topic_score_codex":0.0036906798,"about_ca_topic_score_gemma":0.0049671093,"teacher_disagreement_score":0.010841073,"about_ca_system_score_codex":0.0014400245,"about_ca_system_score_gemma":0.004106447,"threshold_uncertainty_score":0.036266983},"labels":[],"label_agreement":null}]}