{"meta":{"query_hash":"ad6497fcacec","filters":{"venue":"Data Mining and Knowledge Discovery"},"cohort_total":49,"direct_labels_cover":0,"predictions_cover":49,"exported":49,"export_cap":100000,"truncated":false,"label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12"},"permalink":"https://metacan.xera.ac/q/ad6497fcacec","api":"https://metacan.xera.ac/api/v1/cohort?venue=Data+Mining+and+Knowledge+Discovery"},"results":[{"id":"W1603563923","doi":"10.1023/a:1022419032620","title":"Extracting Share Frequent Itemsets with Infrequent Subsets","year":2003,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":77,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Data mining; Association rule learning; Computer science; Measure (data warehouse); Property (philosophy); Database transaction; Heuristic; Set (abstract data type); Closure (psychology); Artificial intelligence; Database","score_opus":0.051266264070474,"score_gpt":0.2920698709287232,"score_spread":0.24080360685824923,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1603563923","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.47214955,0.001146708,0.5150251,0.00055619277,0.0003352791,0.00079550256,0.0034675384,0.0023096628,0.004214488],"genre_scores_gemma":[0.6072561,0.00056710304,0.37652043,0.00011800132,0.00041676767,0.000305962,0.011916996,0.00019684102,0.0027018206],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9976024,0.00027365272,0.00038591112,0.00043721366,0.0010300428,0.00027088355],"domain_scores_gemma":[0.99241346,0.0029747623,0.00088459917,0.0016584645,0.0016899197,0.00037888088],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0015724883,0.0013630749,0.002251542,0.0073605594,0.0015574812,0.0027538536,0.0018697787,0.0014604478,0.0035796561],"category_scores_gemma":[0.010449158,0.00090428,0.0022170667,0.0076067112,0.00051878294,0.0039465725,0.0019480676,0.0011527818,0.0025788709],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0030262708,0.0010735372,0.07644452,0.0009057978,0.0011655736,0.005128957,0.0010765893,0.010011311,0.05625634,0.0080619855,0.0090630995,0.827786],"study_design_scores_gemma":[0.00076539797,0.0037341153,0.07774067,0.0004411373,0.003893983,0.023755014,0.005566013,0.6074957,0.14326634,0.08531866,0.047760155,0.000262851],"about_ca_topic_score_codex":0.0007377396,"about_ca_topic_score_gemma":0.0014588654,"teacher_disagreement_score":0.0073605594,"about_ca_system_score_codex":0.0003702138,"about_ca_system_score_gemma":0.001306992,"threshold_uncertainty_score":0.01197511},"labels":[],"label_agreement":null},{"id":"W1964878798","doi":"10.1007/s10618-010-0208-4","title":"Publishing anonymous survey rating data","year":2010,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Privacy-Preserving Technologies in Data","field":"Computer Science","cited_by":56,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Anonymity; Computer science; Database transaction; Graph; Information retrieval; Personally identifiable information; Internet privacy; Data mining; Similarity (geometry); k-anonymity; Computer security; Theoretical computer science; Database; Artificial intelligence","score_opus":0.12267994048886485,"score_gpt":0.3328434296471469,"score_spread":0.21016348915828206,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1964878798","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":"reproducibility","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":"reproducibility","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.12773094,0.002428321,0.6864615,0.014697701,0.0033805978,0.0010163967,0.07800538,0.009019743,0.07725938],"genre_scores_gemma":[0.8230707,0.0013784424,0.08293692,0.0011400388,0.0013963938,0.00061340915,0.037343018,0.0004270402,0.051694058],"study_design_codex":"design_other","study_design_gemma":"not_applicable","domain_scores_codex":[0.9800805,0.008225473,0.001305708,0.0023869933,0.0070091626,0.0009921426],"domain_scores_gemma":[0.9068324,0.024711788,0.0052305968,0.0519529,0.010125856,0.0011464051],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.011153513,0.00071612484,0.0018011482,0.0029474152,0.0012023328,0.004463987,0.0020853013,0.0020764284,0.014685041],"category_scores_gemma":[0.09362465,0.00079916464,0.0009956212,0.006454316,0.0010350173,0.004771827,0.0021093294,0.0019932494,0.011001408],"study_design_candidate":"not_applicable","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0016741747,0.0004191632,0.036186107,0.00065212726,0.00045338346,0.00069601747,0.000853941,0.04511751,0.0031045368,0.20662843,0.250856,0.45335868],"study_design_scores_gemma":[0.0002742399,0.00031533616,0.014926851,0.00023004138,0.00025242032,0.0015486903,0.0008024602,0.4050463,0.011536986,0.32857972,0.23629555,0.00019131506],"about_ca_topic_score_codex":0.00496924,"about_ca_topic_score_gemma":0.006544378,"teacher_disagreement_score":0.9888465,"about_ca_system_score_codex":0.0015709029,"about_ca_system_score_gemma":0.0024356549,"threshold_uncertainty_score":0.058986127},"labels":[],"label_agreement":null},{"id":"W1972588194","doi":"10.1007/s10618-009-0156-z","title":"Time to CARE: a collaborative engine for practical disease prediction","year":2009,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":147,"is_retracted":false,"has_abstract":false,"route_ca_aff":false,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"","funders":"Centers for Disease Control and Prevention; McGill University","keywords":"Computer science; Action (physics); Disease; Collaborative filtering; Health care; Order (exchange); Risk analysis (engineering); Medical costs; Machine learning; Recommender system; Medicine","score_opus":0.03094374567114801,"score_gpt":0.35021581576609206,"score_spread":0.31927207009494407,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1972588194","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.025570912,0.001487862,0.8023174,0.0021002488,0.00076948665,0.0009059707,0.025034986,0.13280946,0.009003695],"genre_scores_gemma":[0.19665655,0.0011858729,0.74413055,0.0012163298,0.0003565917,0.00090931496,0.041213904,0.004131437,0.010199367],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99799204,0.0003554139,0.00037055183,0.00044450638,0.00073314185,0.0001043171],"domain_scores_gemma":[0.9897804,0.0054866034,0.0005616357,0.002138265,0.0011981751,0.0008348265],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045506475,0.0016967867,0.0015997187,0.00499421,0.001018927,0.0024410659,0.0025953306,0.0018165645,0.012703592],"category_scores_gemma":[0.021419868,0.0006368564,0.0017061497,0.0039750217,0.00036525473,0.003487008,0.0031203865,0.001243705,0.005183405],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.004516285,0.0007943138,0.024907608,0.0010949222,0.0009265026,0.0010828148,0.0011294557,0.02632057,0.0062687253,0.02497943,0.19503525,0.71294415],"study_design_scores_gemma":[0.0007777857,0.00047769907,0.006020411,0.00024428827,0.0010739792,0.001141295,0.00039262103,0.7235826,0.023479324,0.08046527,0.16201314,0.0003315003],"about_ca_topic_score_codex":0.012224192,"about_ca_topic_score_gemma":0.014461677,"teacher_disagreement_score":0.012703592,"about_ca_system_score_codex":0.0007574023,"about_ca_system_score_gemma":0.0022018766,"threshold_uncertainty_score":0.042497754},"labels":[],"label_agreement":null},{"id":"W1999518899","doi":"10.1007/s10618-014-0398-2","title":"Mining outlying aspects on numeric data","year":2015,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":70,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"China Postdoctoral Science Foundation; National Natural Science Foundation of China","keywords":"Subspace topology; Object (grammar); Outlier; Computer science; Data mining; Set (abstract data type); Rank (graph theory); Heuristic; Curse of dimensionality; Measure (data warehouse); Data set; Mathematics; Artificial intelligence; Combinatorics","score_opus":0.16263658103088974,"score_gpt":0.34844677869115825,"score_spread":0.18581019766026852,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W1999518899","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.6128554,0.0013249096,0.37772253,0.0011191993,0.00013019424,0.00014907538,0.0020449033,0.0019668671,0.0026869688],"genre_scores_gemma":[0.83870775,0.0006391647,0.1554639,0.00017263588,0.00018844736,0.00008904442,0.003435644,0.0002063196,0.0010971318],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9962114,0.00042632502,0.0005044695,0.00066596555,0.0019351871,0.00025665524],"domain_scores_gemma":[0.97268265,0.0121404035,0.005294499,0.004979481,0.004311825,0.00059104554],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0024793018,0.0007806382,0.0012203169,0.005686093,0.0010441093,0.002504597,0.0014119699,0.0009756576,0.0007559061],"category_scores_gemma":[0.02586422,0.0004243968,0.0009766672,0.006963037,0.0011595925,0.0050398493,0.0019852982,0.0018191749,0.00034556683],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00085509685,0.00036277244,0.4227242,0.00068956177,0.00044469387,0.004577211,0.002760668,0.021389347,0.02432215,0.026758723,0.005293347,0.48982227],"study_design_scores_gemma":[0.00006128171,0.0005341182,0.12549852,0.0004401062,0.0007220343,0.0062814406,0.0039611957,0.59356356,0.0394789,0.2039662,0.025355102,0.00013760693],"about_ca_topic_score_codex":0.0016582436,"about_ca_topic_score_gemma":0.0024486363,"teacher_disagreement_score":0.005686093,"about_ca_system_score_codex":0.0006256874,"about_ca_system_score_gemma":0.0012731786,"threshold_uncertainty_score":0.013111949},"labels":[],"label_agreement":null},{"id":"W2002041176","doi":"10.1007/s10618-006-0046-6","title":"Relational peculiarity-oriented mining","year":2007,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Rough Sets and Fuzzy Logic","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"National Natural Science Foundation of China","keywords":"Relevance (law); Computer science; Identification (biology); Relational database; Data mining; Task (project management); Focus (optics); Information retrieval; Engineering","score_opus":0.0726774133759716,"score_gpt":0.2994970904899545,"score_spread":0.22681967711398288,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2002041176","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.19454014,0.0021849924,0.76296693,0.0018163056,0.00016307777,0.0003906574,0.0016809155,0.0011633837,0.03509361],"genre_scores_gemma":[0.74608856,0.001788391,0.2442667,0.00035100218,0.00019001718,0.00012743483,0.002159073,0.00010098274,0.0049278997],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9986235,0.0002614072,0.00012665697,0.00041619444,0.00047439738,0.00009786042],"domain_scores_gemma":[0.9968753,0.0010264503,0.00043658138,0.00096973684,0.00055672036,0.00013514988],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018609043,0.00047199157,0.000691908,0.0032765765,0.0008838186,0.0023828389,0.0014395604,0.00043014073,0.0026539152],"category_scores_gemma":[0.0069602453,0.00025858096,0.0009505679,0.0045256107,0.0012882204,0.0038619805,0.0016828335,0.00084905676,0.0006761827],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00027763649,0.00020146254,0.07578823,0.00091820845,0.00047520682,0.0013556225,0.0019117697,0.00951111,0.010976319,0.4433631,0.00659431,0.448627],"study_design_scores_gemma":[0.000049240603,0.0001533085,0.027357807,0.00019002159,0.0006485448,0.0032179845,0.0017746869,0.10908994,0.011800897,0.7947787,0.050852414,0.00008637761],"about_ca_topic_score_codex":0.00082922215,"about_ca_topic_score_gemma":0.0011756903,"teacher_disagreement_score":0.0032765765,"about_ca_system_score_codex":0.00054512644,"about_ca_system_score_gemma":0.0009504379,"threshold_uncertainty_score":0.009841502},"labels":[],"label_agreement":null},{"id":"W2005934890","doi":"10.1007/s10618-013-0336-8","title":"Clustering categorical data in projected spaces","year":2013,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":23,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Cluster analysis; Categorical variable; Computer science; Data mining; Outlier; CURE data clustering algorithm; Curse of dimensionality; Clustering high-dimensional data; Correlation clustering; Canopy clustering algorithm; Data stream clustering; Anomaly detection; Probabilistic logic; Set (abstract data type); Artificial intelligence; Pattern recognition (psychology); Machine learning","score_opus":0.09257415986957443,"score_gpt":0.3536923389834265,"score_spread":0.26111817911385204,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2005934890","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.026683636,0.0002873314,0.9716309,0.0002125753,0.000037361515,0.000056232595,0.00029771763,0.00020170689,0.00059259066],"genre_scores_gemma":[0.4011313,0.00083621166,0.5930611,0.00010979081,0.00016111461,0.00030804108,0.0023523725,0.00010892633,0.001931086],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9939646,0.002668276,0.00037810704,0.00089254667,0.0018633271,0.00023310866],"domain_scores_gemma":[0.9905229,0.00468479,0.00065285,0.0015052943,0.00226564,0.00036852362],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0035654467,0.0006601155,0.0014429196,0.0032962754,0.0009856101,0.0041706287,0.0016828232,0.00086424215,0.00182067],"category_scores_gemma":[0.019665848,0.0004967592,0.001414593,0.0059513766,0.0018691374,0.0038612979,0.0032101902,0.0020124977,0.0006795465],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00067602674,0.00034449837,0.015950983,0.00076244806,0.00041160182,0.00025594697,0.0018769094,0.21932463,0.006321073,0.28259137,0.005340605,0.4661439],"study_design_scores_gemma":[0.000023607923,0.000114582086,0.0023722316,0.00006407911,0.00003795208,0.00016626359,0.00059378677,0.7229326,0.001872669,0.26872396,0.0030531061,0.00004528843],"about_ca_topic_score_codex":0.0027820426,"about_ca_topic_score_gemma":0.0021047967,"teacher_disagreement_score":0.0041706287,"about_ca_system_score_codex":0.0010668829,"about_ca_system_score_gemma":0.0012404603,"threshold_uncertainty_score":0.018856108},"labels":[],"label_agreement":null},{"id":"W2010971425","doi":"10.1007/s10618-011-0212-3","title":"Measuring the component overlapping in the Gaussian mixture model","year":2011,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Cluster analysis; Gaussian; Computer science; Algorithm; Set (abstract data type); Component (thermodynamics); Multivariate normal distribution; Mixture model; Measure (data warehouse); Mathematics; Data mining; Multivariate statistics; Pattern recognition (psychology); Artificial intelligence; Machine learning","score_opus":0.16375358936821682,"score_gpt":0.3177989488666944,"score_spread":0.15404535949847759,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2010971425","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.104691975,0.0005797641,0.8925421,0.00016761836,0.00004299302,0.00004140039,0.00009155746,0.00034483965,0.0014977237],"genre_scores_gemma":[0.7774403,0.0006471138,0.2202113,0.00010289531,0.00009189534,0.00009057267,0.0004989449,0.00019375661,0.00072315236],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99365073,0.0023711636,0.00030646432,0.0011681983,0.0020321736,0.00047132323],"domain_scores_gemma":[0.98016584,0.013533266,0.0011743645,0.002590504,0.002015208,0.00052077783],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0075767036,0.0011496784,0.0017119062,0.0037605762,0.0012339038,0.003047348,0.0021406831,0.0027547693,0.0011378662],"category_scores_gemma":[0.042159148,0.00081434485,0.0012458283,0.0037610896,0.0020286303,0.005212673,0.0029722885,0.0017939276,0.0005117311],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0017720963,0.00038802528,0.055629756,0.00055310264,0.0010347493,0.0004554652,0.0016608009,0.5435554,0.026670482,0.101823375,0.0029652668,0.26349142],"study_design_scores_gemma":[0.000015135876,0.00007522311,0.008059748,0.000028314049,0.0001262048,0.00032398463,0.00013852125,0.9529648,0.0042932983,0.032975197,0.00093927386,0.00006025826],"about_ca_topic_score_codex":0.0048893066,"about_ca_topic_score_gemma":0.0027131308,"teacher_disagreement_score":0.0075767036,"about_ca_system_score_codex":0.0011677141,"about_ca_system_score_gemma":0.0012546225,"threshold_uncertainty_score":0.040069938},"labels":[],"label_agreement":null},{"id":"W2032708445","doi":"10.1007/s10618-007-0086-6","title":"Classification trees and decision-analytic feedforward control: a case study from the video game industry","year":2008,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Modeling, Simulation, and Optimization","field":"Mathematics","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Feed forward; Video game; Model predictive control; Decision tree; Probabilistic logic; Control (management); Machine learning; Artificial intelligence; Data mining; Engineering; Multimedia; Control engineering","score_opus":0.1710043822641238,"score_gpt":0.36814963869519823,"score_spread":0.19714525643107444,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2032708445","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.86941975,0.0007729685,0.11832502,0.0017330117,0.0000496275,0.0003061053,0.00021459811,0.00014538171,0.009033514],"genre_scores_gemma":[0.9719302,0.00019091489,0.02574265,0.00006277556,0.000014124588,0.000063299,0.00009151342,0.00001475199,0.00188986],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.998607,0.000781849,0.00005300577,0.00010790966,0.00031774177,0.00013259477],"domain_scores_gemma":[0.984251,0.013893584,0.00041503983,0.0003222759,0.0008437431,0.00027443905],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0033695707,0.00052148366,0.00054522493,0.0010630753,0.0011488118,0.0013904804,0.0011761654,0.0022361395,0.0022253108],"category_scores_gemma":[0.013678345,0.00020665879,0.00047710512,0.0017730176,0.0010077338,0.0013077024,0.000605438,0.00121194,0.00020092636],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0018636241,0.0022398022,0.034811098,0.00049146445,0.00015290141,0.0034974108,0.002154534,0.686238,0.0024826138,0.062075213,0.0058139917,0.19817932],"study_design_scores_gemma":[0.00012228718,0.00039493342,0.0056129466,0.000038145306,0.000036461177,0.00022423067,0.0010324747,0.9609588,0.001357015,0.02733493,0.0028574106,0.00003033417],"about_ca_topic_score_codex":0.020953229,"about_ca_topic_score_gemma":0.022219082,"teacher_disagreement_score":0.020953229,"about_ca_system_score_codex":0.0014464518,"about_ca_system_score_gemma":0.0013743947,"threshold_uncertainty_score":0.041662574},"labels":[],"label_agreement":null},{"id":"W2061678866","doi":"10.1007/s10618-013-0330-1","title":"What distinguish one from its peers in social networks?","year":2013,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Complex Network Analysis Techniques","field":"Physics and Astronomy","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Natural Sciences and Engineering Research Council of Canada; National Taiwan University; National Science Council; Intel Corporation","keywords":"Uniqueness; Identification (biology); Computer science; Task (project management); Vertex (graph theory); Group (periodic table); Social network (sociolinguistics); Social network analysis; Theoretical computer science; Data mining; Machine learning; Graph; Mathematics; World Wide Web; Social media; Engineering","score_opus":0.051955979837728185,"score_gpt":0.3072964131251066,"score_spread":0.2553404332873784,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2061678866","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.9245435,0.00244963,0.04193819,0.007628592,0.00021326245,0.00014018314,0.0014535803,0.00019468369,0.02143837],"genre_scores_gemma":[0.991396,0.0005264578,0.0063964813,0.00017978484,0.00015278177,0.000037006736,0.00036484373,0.00002186907,0.0009247494],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.998632,0.00037246337,0.000084199,0.0003655734,0.00039494524,0.00015073155],"domain_scores_gemma":[0.9900705,0.006118118,0.0014365893,0.0004882696,0.0010327755,0.00085381273],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0014682631,0.00028584123,0.00070993387,0.0030032576,0.0011719698,0.0027512293,0.0008994996,0.0013067555,0.0016589818],"category_scores_gemma":[0.018866513,0.0001836376,0.00027593868,0.0019561937,0.0011611196,0.007627993,0.001127994,0.000723456,0.0005674022],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00064883486,0.00043147424,0.5245116,0.0009541348,0.0005968033,0.0012573806,0.008587329,0.005592626,0.00645833,0.08334793,0.016462123,0.35115144],"study_design_scores_gemma":[0.00014811884,0.0004397196,0.29968184,0.0006721703,0.0012083476,0.003845627,0.0498738,0.12460629,0.009669505,0.45376503,0.055851117,0.00023844386],"about_ca_topic_score_codex":0.0033411568,"about_ca_topic_score_gemma":0.0051292204,"teacher_disagreement_score":0.0033411568,"about_ca_system_score_codex":0.00058565295,"about_ca_system_score_gemma":0.0004591098,"threshold_uncertainty_score":0.007764995},"labels":[],"label_agreement":null},{"id":"W2072732320","doi":"10.1007/s10618-005-0019-1","title":"Data Clustering with Partial Supervision","year":2006,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":75,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cluster analysis; Computer science; Artificial intelligence; Classifier (UML); Pattern recognition (psychology); Fuzzy clustering; Machine learning; Support vector machine; Data mining","score_opus":0.07186957610495115,"score_gpt":0.33223066228592213,"score_spread":0.260361086180971,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2072732320","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00929492,0.00024162678,0.9879447,0.00025821116,0.00003962943,0.00007452391,0.00026017454,0.0010523914,0.0008337929],"genre_scores_gemma":[0.3790835,0.00038088727,0.61392075,0.00018762748,0.00021651624,0.00037325994,0.002162853,0.00025771192,0.0034168917],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9943514,0.0021377027,0.00041709328,0.0013617767,0.0015583296,0.0001736776],"domain_scores_gemma":[0.9855563,0.0041386504,0.00079656957,0.007122415,0.002040097,0.00034593552],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0045554065,0.0008085172,0.0021845875,0.001374606,0.0013022163,0.0020903272,0.0026164216,0.0012032968,0.0028480361],"category_scores_gemma":[0.022083798,0.0011221461,0.001975679,0.0021141586,0.0017512761,0.004056206,0.003653304,0.001552107,0.0013926757],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0009985493,0.0002153772,0.008193932,0.00078276347,0.00061026827,0.00030593295,0.0005634647,0.2593059,0.007974184,0.06632493,0.012525273,0.64219946],"study_design_scores_gemma":[0.000030296835,0.000077334764,0.0007943041,0.000021960823,0.000055325727,0.00015783259,0.000039333376,0.93922615,0.0036000486,0.053064764,0.0029143463,0.000018352805],"about_ca_topic_score_codex":0.0024099296,"about_ca_topic_score_gemma":0.0039341343,"teacher_disagreement_score":0.0045554065,"about_ca_system_score_codex":0.00080778525,"about_ca_system_score_gemma":0.0026417396,"threshold_uncertainty_score":0.024091542},"labels":[],"label_agreement":null},{"id":"W2073184692","doi":"10.1007/s10618-005-1359-6","title":"Data Mining for Inventory Item Selection with Cross-Selling Considerations","year":2005,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":70,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Association rule learning; Computer science; Data mining; Profit (economics); Selection (genetic algorithm); Greedy algorithm; Machine learning; Algorithm; Economics","score_opus":0.10575153970874877,"score_gpt":0.3499721572955075,"score_spread":0.24422061758675873,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2073184692","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.25291735,0.0042956676,0.7220311,0.0019450964,0.00027138088,0.000606527,0.004077391,0.001141816,0.012713704],"genre_scores_gemma":[0.75691193,0.0008123646,0.23362523,0.00021523908,0.0002921006,0.0003090598,0.003915254,0.00007253004,0.0038462454],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99669755,0.00083998754,0.00040959808,0.000725933,0.0011591386,0.0001678758],"domain_scores_gemma":[0.9888958,0.0076374584,0.0007471894,0.0012475009,0.0012764344,0.00019567701],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004446562,0.0009305151,0.0019039387,0.0042691766,0.0011163482,0.0031139038,0.0018607157,0.0009561267,0.005448673],"category_scores_gemma":[0.019926373,0.00068119966,0.0019267687,0.0059620263,0.00057748676,0.003994374,0.001203365,0.0013000935,0.0010608946],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001990671,0.0012145969,0.12547451,0.0011520879,0.0011734884,0.0020015733,0.00040730563,0.102244444,0.0044379835,0.038259387,0.012708386,0.7089356],"study_design_scores_gemma":[0.00012496562,0.00054847397,0.023921179,0.00022489607,0.0005565143,0.0019230465,0.00042682028,0.8859912,0.006802899,0.068363704,0.011050297,0.00006610526],"about_ca_topic_score_codex":0.0011605578,"about_ca_topic_score_gemma":0.001762806,"teacher_disagreement_score":0.005448673,"about_ca_system_score_codex":0.00075936154,"about_ca_system_score_gemma":0.0011196289,"threshold_uncertainty_score":0.023516},"labels":[],"label_agreement":null},{"id":"W2075949491","doi":"10.1007/s10618-012-0300-z","title":"Local outlier detection reconsidered: a generalized view on locality with applications to spatial, video, and network outlier detection","year":2012,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":294,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Locality; Anomaly detection; Computer science; Outlier; Generalization; Data mining; Artificial intelligence; Graph; Machine learning; Pattern recognition (psychology); Theoretical computer science; Mathematics","score_opus":0.040746817394101985,"score_gpt":0.2935640976154808,"score_spread":0.25281728022137884,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2075949491","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012785002,0.0029383833,0.9758567,0.0058359373,0.00020162102,0.000031355445,0.00011202043,0.00019152153,0.0020473977],"genre_scores_gemma":[0.6994204,0.0056729494,0.28638625,0.0017737792,0.0032804215,0.00015211206,0.00025082676,0.00020750705,0.0028557242],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99295205,0.0023589996,0.0005071025,0.001803861,0.0019242084,0.00045376772],"domain_scores_gemma":[0.970076,0.016573131,0.0025225512,0.004989086,0.0047830455,0.0010561876],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0071131424,0.0011560186,0.004196495,0.0050363187,0.0020908278,0.008104287,0.005604001,0.0041166996,0.0015228812],"category_scores_gemma":[0.028991701,0.00088579266,0.0027952937,0.0071481713,0.009988977,0.015383106,0.00696527,0.0060321754,0.0003173563],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00019434556,0.00016743956,0.011761806,0.00046476626,0.00051726605,0.0010040484,0.0010612431,0.11918788,0.0024996267,0.7001902,0.0064352737,0.1565161],"study_design_scores_gemma":[0.00002378635,0.00008779946,0.0011253302,0.00006865357,0.00013103371,0.00037787855,0.00033217546,0.39620656,0.000793275,0.5962981,0.004484469,0.00007100717],"about_ca_topic_score_codex":0.0067240656,"about_ca_topic_score_gemma":0.0056234887,"teacher_disagreement_score":0.008104287,"about_ca_system_score_codex":0.002001858,"about_ca_system_score_gemma":0.001991178,"threshold_uncertainty_score":0.03761834},"labels":[],"label_agreement":null},{"id":"W2078064242","doi":"10.1023/b:dami.0000023674.74932.4c","title":"Pushing Convertible Constraints in Frequent Itemset Mining","year":2004,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":134,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"","keywords":"Constraint (computer-aided design); Computer science; Data mining; Context (archaeology); Association rule learning; Convertible; A priori and a posteriori; Class (philosophy); Apriori algorithm; Monotonic function; Sequential Pattern Mining; Artificial intelligence; Mathematics; Engineering; Geography","score_opus":0.04812423122534112,"score_gpt":0.2999252304469889,"score_spread":0.2518009992216478,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2078064242","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.061209988,0.0031864594,0.92396307,0.0022040133,0.00044184053,0.00039710946,0.0015404589,0.0014474405,0.0056095864],"genre_scores_gemma":[0.3256478,0.0022440637,0.6614846,0.000805379,0.00044455964,0.0003639216,0.0034773964,0.00033877513,0.0051934184],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9913293,0.002363333,0.0010018512,0.001404176,0.0034825986,0.0004185825],"domain_scores_gemma":[0.9512032,0.037253078,0.0020197388,0.005807577,0.0030127044,0.0007036111],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007770571,0.0011203683,0.0024950386,0.005193333,0.0017461644,0.005434884,0.0043817377,0.002693982,0.0057859956],"category_scores_gemma":[0.07125326,0.0019642464,0.002228376,0.0071308315,0.002327159,0.013502907,0.005022739,0.005739216,0.0011916584],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012552697,0.0006220003,0.009343117,0.0016320517,0.00043886446,0.0030670112,0.001541019,0.107940264,0.0049430314,0.25365418,0.013216594,0.6023466],"study_design_scores_gemma":[0.00013414597,0.00020466292,0.0013239052,0.00034459884,0.00019795036,0.0012686057,0.0004854435,0.428769,0.0046202815,0.5465281,0.016034681,0.00008863499],"about_ca_topic_score_codex":0.003388511,"about_ca_topic_score_gemma":0.0037205575,"teacher_disagreement_score":0.007770571,"about_ca_system_score_codex":0.000814135,"about_ca_system_score_gemma":0.0016011738,"threshold_uncertainty_score":0.041095197},"labels":[],"label_agreement":null},{"id":"W2079040080","doi":"10.1007/s10618-013-0311-4","title":"A framework for semi-supervised and unsupervised optimal extraction of clusters from hierarchies","year":2013,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":83,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cluster analysis; Computer science; Tree (set theory); Cluster (spacecraft); Variety (cybernetics); Data mining; Artificial intelligence; Extraction (chemistry); Machine learning; Mathematics","score_opus":0.06040773208466434,"score_gpt":0.3443362713711306,"score_spread":0.2839285392864663,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2079040080","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0003578806,0.000065082546,0.999009,0.00004375724,0.000009231741,0.000023238008,0.000052601205,0.00028746756,0.00015162032],"genre_scores_gemma":[0.01760601,0.00011916919,0.9808699,0.000058420785,0.00004026802,0.00013292319,0.00038353426,0.00014142206,0.00064836163],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9961482,0.0011623132,0.00030949723,0.0008732014,0.0012579786,0.00024887783],"domain_scores_gemma":[0.9951792,0.0017755142,0.0003824513,0.001027828,0.0013939227,0.00024102046],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0047129043,0.0011738804,0.0021359995,0.0034727857,0.0019374635,0.0037106322,0.0047548567,0.0019750022,0.002734884],"category_scores_gemma":[0.011648168,0.001068743,0.0025070822,0.0040500406,0.002121405,0.0038019721,0.0046154764,0.0029571534,0.0018301978],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021089043,0.00020919877,0.0012902771,0.00051547284,0.00028583367,0.00025367865,0.0008870711,0.15777513,0.0106559545,0.27801174,0.01594564,0.5339591],"study_design_scores_gemma":[0.000033424214,0.00004685997,0.0003688262,0.00006355796,0.000050944753,0.00015926121,0.000119053155,0.7681822,0.0027566475,0.21802625,0.010142959,0.000050032293],"about_ca_topic_score_codex":0.008027991,"about_ca_topic_score_gemma":0.015189968,"teacher_disagreement_score":0.008027991,"about_ca_system_score_codex":0.0016600689,"about_ca_system_score_gemma":0.0038711927,"threshold_uncertainty_score":0.024924517},"labels":[],"label_agreement":null},{"id":"W2086829791","doi":"10.1007/s10618-011-0221-2","title":"DHCC: Divisive hierarchical clustering of categorical data","year":2011,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":77,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Categorical variable; Cluster analysis; Computer science; Data mining; Initialization; Similarity (geometry); Linear subspace; Single-linkage clustering; Hierarchical clustering; Artificial intelligence; Pattern recognition (psychology); CURE data clustering algorithm; Correlation clustering; Machine learning; Mathematics","score_opus":0.19241456294856188,"score_gpt":0.35658341041610714,"score_spread":0.16416884746754526,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2086829791","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0033370464,0.00033460552,0.9810245,0.00016454906,0.00016145674,0.00042559084,0.0024336348,0.011159172,0.0009594607],"genre_scores_gemma":[0.029774936,0.00020604397,0.961478,0.0001240128,0.000074891825,0.0005166616,0.0052012703,0.00087264186,0.0017515081],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9966754,0.0011234827,0.00023696703,0.0005648898,0.0011925034,0.00020682611],"domain_scores_gemma":[0.9951391,0.0014741125,0.0002268712,0.0015837203,0.0013670189,0.00020921614],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0031861435,0.0013503027,0.0016416556,0.0051628626,0.0016267915,0.0026188253,0.0034556084,0.0013924185,0.0061198743],"category_scores_gemma":[0.014504861,0.0008620228,0.0020251097,0.007430254,0.0006719409,0.0016278939,0.0027894499,0.0022480043,0.0042519635],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00042408897,0.00024775352,0.0036280137,0.00076729053,0.00041261627,0.00016022353,0.000566676,0.047848776,0.0059847413,0.02416062,0.06596284,0.84983635],"study_design_scores_gemma":[0.00016969623,0.00016590423,0.0036284556,0.00012955096,0.00019260119,0.0003882017,0.00029826586,0.839159,0.014006497,0.07377815,0.06792869,0.00015500785],"about_ca_topic_score_codex":0.012267906,"about_ca_topic_score_gemma":0.017289916,"teacher_disagreement_score":0.012267906,"about_ca_system_score_codex":0.0012010592,"about_ca_system_score_gemma":0.003998428,"threshold_uncertainty_score":0.024393022},"labels":[],"label_agreement":null},{"id":"W2091837657","doi":"10.1007/s10618-010-0199-1","title":"Improving constrained pattern mining with first-fail-based heuristics","year":2010,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"HEC Montréal; Polytechnique Montréal; École de Technologie Supérieure","funders":"","keywords":"Heuristics; Data mining; Computer science; Process (computing); Data stream mining; State (computer science); Sequential Pattern Mining; Machine learning; Artificial intelligence; Algorithm","score_opus":0.02107824697066401,"score_gpt":0.2557087373958644,"score_spread":0.2346304904252004,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2091837657","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.04539374,0.0015678367,0.94533557,0.00067141,0.00022946502,0.0004083736,0.00054734567,0.0031888082,0.0026574722],"genre_scores_gemma":[0.29242668,0.0004775158,0.7002919,0.00091683335,0.00019478296,0.0003770455,0.001914073,0.00054534175,0.0028558227],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9944722,0.0019679104,0.00060905865,0.0009725585,0.0014676873,0.00051051384],"domain_scores_gemma":[0.96221054,0.027298525,0.0012787184,0.0051980377,0.0033332352,0.0006810351],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005993431,0.002234811,0.004463254,0.004747842,0.0016994155,0.0032963005,0.0046669166,0.002602617,0.0057356777],"category_scores_gemma":[0.037839267,0.0013233369,0.0027406563,0.0046231877,0.0015018893,0.005825853,0.0032710293,0.0034601667,0.0015358223],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.002134752,0.0013283639,0.014083554,0.000910112,0.0010377562,0.00083398615,0.0004028815,0.24189776,0.0051918724,0.022482838,0.01971238,0.6899837],"study_design_scores_gemma":[0.00019355025,0.0002473155,0.000850538,0.00005622533,0.00023034977,0.000311142,0.000091996044,0.96678424,0.00220951,0.026731811,0.002255814,0.000037427788],"about_ca_topic_score_codex":0.00839112,"about_ca_topic_score_gemma":0.014048917,"teacher_disagreement_score":0.00839112,"about_ca_system_score_codex":0.0010018918,"about_ca_system_score_gemma":0.0041619237,"threshold_uncertainty_score":0.031696618},"labels":[],"label_agreement":null},{"id":"W2093446553","doi":"10.1007/s10618-005-0022-6","title":"An Erratum on #x201C;Pushing Convertible Constraints in Frequent Itemset Mining#x201D;","year":2006,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia; Simon Fraser University","funders":"","keywords":"Prefix; Order (exchange); Combinatorics; Convertible; Function (biology); Mathematics; Physics; Philosophy; Linguistics; Biology; Business; Genetics","score_opus":0.03631538169184479,"score_gpt":0.29980017754183547,"score_spread":0.2634847958499907,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2093446553","genre_codex":"editorial","genre_gemma":"other","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"other","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00046527822,0.0020234282,0.008980656,0.16712935,0.80919164,0.00009499825,0.0016271045,0.00084518705,0.00964231],"genre_scores_gemma":[0.012728968,0.008806128,0.05266488,0.25600886,0.44776735,0.00049899414,0.0049591926,0.0019381713,0.21462737],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.9915079,0.0012612502,0.0010690661,0.0008664301,0.0047802636,0.0005151304],"domain_scores_gemma":[0.9519758,0.017213985,0.0015558802,0.0032758904,0.024074009,0.001904448],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0049505266,0.0022400175,0.0022748369,0.0054654707,0.0071383845,0.0065911175,0.004811122,0.010287471,0.02493144],"category_scores_gemma":[0.061696175,0.0014873453,0.0017915735,0.0049467133,0.0033277012,0.0040147793,0.0024486564,0.013317502,0.016445769],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000023111752,0.000011858239,0.000049484166,0.000053921343,0.000007245251,0.00008787886,0.000014748531,0.00006759068,0.00008394413,0.0013038567,0.9921515,0.006144894],"study_design_scores_gemma":[0.00004484392,0.000035745463,0.0006525701,0.00019990833,0.0000529155,0.00033243946,0.00008069881,0.0016606777,0.00080483884,0.0068121194,0.9892615,0.00006176333],"about_ca_topic_score_codex":0.04665974,"about_ca_topic_score_gemma":0.06422651,"teacher_disagreement_score":0.04665974,"about_ca_system_score_codex":0.00517638,"about_ca_system_score_gemma":0.006817111,"threshold_uncertainty_score":0.0927763},"labels":[],"label_agreement":null},{"id":"W2098162950","doi":"10.1023/b:dami.0000023675.04946.f1","title":"Building Association-Rule Based Sequential Classifiers for Web-Document Prediction","year":2004,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Computer science; Association rule learning; Data mining; Web application; Predictive modelling; Web server; Association (psychology); Web mining; Machine learning; Web page; Information retrieval; World Wide Web; The Internet","score_opus":0.03959326074880023,"score_gpt":0.3087525581662589,"score_spread":0.2691592974174587,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2098162950","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.11026667,0.0011919198,0.87741244,0.00044128048,0.00031954344,0.0005861175,0.0014947813,0.006149533,0.0021377904],"genre_scores_gemma":[0.29582405,0.0006145509,0.6944715,0.00020073283,0.0003006115,0.00052050996,0.003836523,0.00016947529,0.0040620575],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99781466,0.00033501277,0.00032347877,0.00058457087,0.0007595075,0.00018281728],"domain_scores_gemma":[0.9902829,0.005532743,0.0005306698,0.0007653629,0.0025494585,0.00033898136],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0040832986,0.0011567165,0.0021999236,0.0047894316,0.0010792849,0.0019538705,0.0021364437,0.0019452549,0.0026173487],"category_scores_gemma":[0.011140641,0.00076865545,0.0014221822,0.0029262379,0.00044997683,0.0030622226,0.0009944532,0.0020316415,0.0028812303],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00078092783,0.0009576234,0.026639368,0.00029823964,0.00032606535,0.00047702782,0.00013987705,0.047960147,0.011798053,0.0024552594,0.00864098,0.8995265],"study_design_scores_gemma":[0.00005050786,0.0002488537,0.0022747135,0.000034989145,0.0001723718,0.00030862578,0.000052954205,0.97819203,0.009758197,0.0061448663,0.0027331545,0.000028659755],"about_ca_topic_score_codex":0.006652573,"about_ca_topic_score_gemma":0.008279706,"teacher_disagreement_score":0.006652573,"about_ca_system_score_codex":0.0006365745,"about_ca_system_score_gemma":0.0022782278,"threshold_uncertainty_score":0.021594822},"labels":[],"label_agreement":null},{"id":"W2106700114","doi":"10.1007/s10618-012-0257-y","title":"Guest editorial: special issue on a decade of mining the Web","year":2012,"lang":"en","type":"editorial","venue":"Data Mining and Knowledge Discovery","topic":"Web Data Mining and Analysis","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Web mining; World Wide Web; Computer science; Data science; Domain (mathematical analysis); Web intelligence; Web development; The Internet; Web page","score_opus":0.02640097352747741,"score_gpt":0.29970399963040983,"score_spread":0.27330302610293244,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2106700114","genre_codex":"editorial","genre_gemma":"editorial","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"editorial","genre_consensus":"editorial","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.000027486307,0.005134751,0.00012208176,0.024627257,0.969138,0.0000116946885,0.00004997384,0.000042606596,0.0008461766],"genre_scores_gemma":[0.0002774598,0.0036413192,0.00011744154,0.0092667155,0.9809971,0.000014510774,0.000037112914,0.00003867278,0.0056096283],"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","domain_scores_codex":[0.993512,0.0010367059,0.0007581705,0.0008912482,0.003322983,0.00047884823],"domain_scores_gemma":[0.96270037,0.011951606,0.0028115555,0.0009171404,0.016112903,0.0055063646],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007987171,0.0036990882,0.004478125,0.0067825974,0.0030681111,0.010900081,0.003323148,0.010650857,0.017602824],"category_scores_gemma":[0.030964632,0.0013121819,0.0027092448,0.0027588804,0.002650972,0.0047526257,0.001847062,0.016115746,0.012180073],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000031312393,0.000011342426,0.000027162994,0.00016512083,0.000018737184,0.00007309381,0.0000070744995,0.000010104675,0.00004584702,0.00013875517,0.99598336,0.0034879688],"study_design_scores_gemma":[0.000057025933,0.000036336525,0.00036344465,0.00045660397,0.00008241004,0.00031800385,0.00004905686,0.00015328391,0.00017447122,0.00091642555,0.99737203,0.000020794972],"about_ca_topic_score_codex":0.0011204296,"about_ca_topic_score_gemma":0.0040338533,"teacher_disagreement_score":0.017602824,"about_ca_system_score_codex":0.0025259855,"about_ca_system_score_gemma":0.0030916857,"threshold_uncertainty_score":0.058887362},"labels":[],"label_agreement":null},{"id":"W2115482638","doi":"10.1023/b:dami.0000005258.31418.83","title":"Mining Frequent Patterns without Candidate Generation: A Frequent-Pattern Tree Approach","year":2003,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":2615,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Data mining; Computer science; Scalability; Tree (set theory); Set (abstract data type); Apriori algorithm; GSP Algorithm; Association rule learning; Trie; Tree structure; Pattern recognition (psychology); Data structure; Artificial intelligence; Database; Mathematics","score_opus":0.06223377143017436,"score_gpt":0.29063549100603664,"score_spread":0.22840171957586228,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2115482638","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.015540487,0.0007677517,0.9811126,0.00036274185,0.0000735874,0.00025755877,0.0005567197,0.0007541402,0.0005744072],"genre_scores_gemma":[0.09764457,0.0006919973,0.89796776,0.00020486343,0.00015232248,0.00023687597,0.0019381226,0.000117852265,0.0010457486],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9948336,0.0012880629,0.0005897361,0.001057398,0.001971786,0.0002594239],"domain_scores_gemma":[0.9828394,0.011822382,0.0009671408,0.0019243362,0.0021089658,0.00033776354],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005180415,0.0013000112,0.0032327133,0.004975306,0.0014235725,0.0034171168,0.0043475204,0.0025914365,0.002064071],"category_scores_gemma":[0.022039149,0.0010614758,0.0026218898,0.0060721207,0.0010220045,0.0061683636,0.0019202031,0.0022507547,0.0018815331],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010310683,0.001224696,0.013310004,0.0013528459,0.00077918754,0.0021127616,0.0004719143,0.038808662,0.0124722095,0.023623649,0.0089901965,0.89582276],"study_design_scores_gemma":[0.0002655924,0.00060924364,0.0023457075,0.00016885977,0.0007396905,0.0036782988,0.00032303424,0.8846376,0.008669051,0.0908212,0.007629762,0.00011199995],"about_ca_topic_score_codex":0.0010077553,"about_ca_topic_score_gemma":0.0015396416,"teacher_disagreement_score":0.005180415,"about_ca_system_score_codex":0.00040257652,"about_ca_system_score_gemma":0.0018241032,"threshold_uncertainty_score":0.027396977},"labels":[],"label_agreement":null},{"id":"W2116064560","doi":"10.1007/s10618-005-0248-3","title":"Mining Web Log Sequential Patterns with Position Coded Pre-Order Linked WAP-Tree","year":2005,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":131,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Web log analysis software; Tree (set theory); Trie; Suffix tree; Prefix; Data mining; Subsequence; Web mining; Node (physics); Web server; Fractal tree index; Tree structure; Interval tree; Web page; Data structure; Algorithm; The Internet; World Wide Web; Mathematics; Binary tree; Static web page","score_opus":0.03043223887843423,"score_gpt":0.2874098398765441,"score_spread":0.2569776009981099,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2116064560","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.5177175,0.00056133926,0.45766583,0.00047686562,0.00014078627,0.0006583247,0.010545723,0.007308394,0.004925318],"genre_scores_gemma":[0.7005172,0.00019770915,0.28464252,0.000082408464,0.000044670018,0.00027089263,0.011100974,0.00018437025,0.0029592593],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9993704,0.000074171476,0.00007431507,0.00012425223,0.00027375732,0.00008307207],"domain_scores_gemma":[0.997134,0.0011070856,0.0003126317,0.00050053734,0.00078559556,0.00016017385],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005223575,0.00040836495,0.0005828464,0.004766338,0.0008250256,0.001168149,0.0009660025,0.0007547274,0.0019632874],"category_scores_gemma":[0.0053360937,0.00033619313,0.0007076811,0.004870439,0.00032884185,0.0016362119,0.00067967025,0.00075847376,0.0010580372],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001794458,0.0012917713,0.1252399,0.00078961236,0.00029643154,0.0027029128,0.00059119245,0.07023752,0.027731208,0.01470895,0.017101133,0.737515],"study_design_scores_gemma":[0.00007652842,0.0003251839,0.014477587,0.00008038871,0.00014697514,0.0011535183,0.00040841402,0.93617,0.013842741,0.02474358,0.008537252,0.00003790231],"about_ca_topic_score_codex":0.0038287025,"about_ca_topic_score_gemma":0.008566475,"teacher_disagreement_score":0.004766338,"about_ca_system_score_codex":0.00041369058,"about_ca_system_score_gemma":0.0013111613,"threshold_uncertainty_score":0.0076128244},"labels":[],"label_agreement":null},{"id":"W2154217032","doi":"10.1007/s10618-009-0133-6","title":"Fast incremental mining of web sequential patterns with PLWAP tree","year":2009,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Data mining; Tree (set theory); Metadata; Web mining; Database; Web log analysis software; Web page; Information retrieval; Web navigation; World Wide Web; Static web page","score_opus":0.0352025202348579,"score_gpt":0.2851548256075449,"score_spread":0.249952305372687,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2154217032","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10378817,0.0011707183,0.8797337,0.00032760898,0.00016238498,0.00044847245,0.003385322,0.008791653,0.0021921282],"genre_scores_gemma":[0.27908906,0.00044870545,0.7112548,0.00009837242,0.00007398587,0.00030447874,0.0062989187,0.00024229714,0.0021894085],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991241,0.00011004627,0.00009772813,0.00016554123,0.00041132915,0.00009108273],"domain_scores_gemma":[0.997486,0.0010919488,0.00020693097,0.00040751306,0.0006813127,0.00012624695],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008474107,0.0005587126,0.00096313574,0.003480332,0.0007403493,0.0011950828,0.0015350919,0.00059853814,0.0018568397],"category_scores_gemma":[0.0055308226,0.00054113485,0.0009366437,0.003947287,0.00026154966,0.0022466916,0.0010791122,0.00080368377,0.0011561778],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061900495,0.00029772156,0.014442552,0.0005609684,0.0001986943,0.0008946408,0.0002249265,0.020826148,0.017367166,0.004538511,0.014292613,0.9257371],"study_design_scores_gemma":[0.00011608323,0.00028011124,0.0050521344,0.00005567854,0.00018734107,0.0014392851,0.0001957757,0.9434766,0.0155340005,0.021471404,0.012157874,0.00003369222],"about_ca_topic_score_codex":0.0031526694,"about_ca_topic_score_gemma":0.005857447,"teacher_disagreement_score":0.003480332,"about_ca_system_score_codex":0.0002513818,"about_ca_system_score_gemma":0.0011770187,"threshold_uncertainty_score":0.0062686205},"labels":[],"label_agreement":null},{"id":"W2158459641","doi":"10.1007/s10618-015-0408-z","title":"Tractome: a visual data mining tool for brain connectivity analysis","year":2015,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Neuroimaging Techniques and Applications","field":"Medicine","cited_by":24,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"","keywords":"Computer science; Visualization; Scalability; Artificial intelligence; Visual analytics; Process (computing); Set (abstract data type); Data visualization; Data set; Data mining; Machine learning; Human–computer interaction; Database","score_opus":0.27892127732114425,"score_gpt":0.467167125821036,"score_spread":0.18824584849989173,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2158459641","genre_codex":"methods","genre_gemma":"software","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"software","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010317909,0.00087279564,0.76057374,0.0006893969,0.00021204172,0.0004105578,0.05882861,0.16362342,0.004471512],"genre_scores_gemma":[0.110710725,0.0013713916,0.82819563,0.00043066128,0.0001438622,0.002161629,0.03960565,0.011712077,0.005668394],"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.9996536,0.000059801372,0.000051197236,0.000097804535,0.00010770202,0.00002986613],"domain_scores_gemma":[0.998175,0.0010996439,0.00021354062,0.00021201144,0.00019479527,0.0001049829],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0010389468,0.001656798,0.00093193114,0.0050179637,0.00060085015,0.0019113363,0.0014702786,0.0009069865,0.026022153],"category_scores_gemma":[0.0071308548,0.00057014805,0.0015776422,0.003161358,0.00039962528,0.0015036402,0.0022032096,0.0012130777,0.004632767],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014396713,0.00023499229,0.0076881745,0.0042553716,0.0010579798,0.0015198732,0.0012351002,0.020105075,0.031427022,0.037833456,0.30852187,0.58468145],"study_design_scores_gemma":[0.00044860932,0.00040737068,0.01329636,0.00089682936,0.0006578374,0.0034415936,0.00055010524,0.43202683,0.05326079,0.18660375,0.30805203,0.000357892],"about_ca_topic_score_codex":0.0043129674,"about_ca_topic_score_gemma":0.007250422,"teacher_disagreement_score":0.026022153,"about_ca_system_score_codex":0.0005177675,"about_ca_system_score_gemma":0.0013152468,"threshold_uncertainty_score":0.08705282},"labels":[],"label_agreement":null},{"id":"W2159328231","doi":"10.1007/s10618-007-0083-9","title":"Mining functional dependencies from data","year":2007,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":90,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Regina","funders":"","keywords":"Correctness; Pruning; Computer science; Data mining; Information loss; Process (computing); Functional dependency; Series (stratigraphy); Axiom; Algorithm; Artificial intelligence; Mathematics; Relational database","score_opus":0.10341483207346523,"score_gpt":0.31561346603796997,"score_spread":0.21219863396450472,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2159328231","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.24997446,0.003117688,0.7079066,0.0026007008,0.0002769143,0.00069006084,0.018919712,0.006621375,0.009892497],"genre_scores_gemma":[0.6248855,0.0020416498,0.32478815,0.00041642404,0.00024979975,0.0006180092,0.04115873,0.0006147268,0.0052270116],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9977489,0.00035756934,0.00020972159,0.0005019616,0.001018464,0.00016332683],"domain_scores_gemma":[0.9883692,0.007944746,0.0008204216,0.0012817462,0.001312535,0.00027129406],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018071919,0.0011451287,0.00081957784,0.006528472,0.0011752757,0.0013366847,0.0015119936,0.0008547136,0.0031583644],"category_scores_gemma":[0.016114263,0.0007398302,0.0015864763,0.0037671512,0.00077601266,0.0039151506,0.0014565518,0.0017284252,0.0013751731],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00070918363,0.00075340224,0.0774849,0.002092498,0.0006063586,0.004297322,0.0010999952,0.034306947,0.024551248,0.05972816,0.033872556,0.7604974],"study_design_scores_gemma":[0.00011806195,0.00047751068,0.036195688,0.00070646516,0.0011484068,0.0046278876,0.0010533922,0.54163086,0.04005851,0.30494916,0.06888306,0.00015105323],"about_ca_topic_score_codex":0.0028739145,"about_ca_topic_score_gemma":0.0063235504,"teacher_disagreement_score":0.006528472,"about_ca_system_score_codex":0.0006388622,"about_ca_system_score_gemma":0.0019920233,"threshold_uncertainty_score":0.010565758},"labels":[],"label_agreement":null},{"id":"W2159694214","doi":"10.1007/s10618-005-0013-7","title":"Discovering Classification from Data of Multiple Sources","year":2006,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Western University","funders":"Hong Kong University of Science and Technology","keywords":"Computer science; Class (philosophy); Artificial intelligence; Perspective (graphical); Machine learning; Supervised learning; Test data; Labeled data; Semi-supervised learning; Data mining; Artificial neural network","score_opus":0.09401072320475932,"score_gpt":0.3028926707297767,"score_spread":0.20888194752501738,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2159694214","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.33147538,0.0069714915,0.6293526,0.004597206,0.000682692,0.0009879175,0.014682208,0.004189003,0.0070615206],"genre_scores_gemma":[0.49210402,0.003294614,0.47946036,0.00047030137,0.0007005545,0.00082449045,0.020048274,0.00034839913,0.0027488966],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9932795,0.0010633039,0.00071283267,0.0013522609,0.0032175577,0.00037459575],"domain_scores_gemma":[0.9758523,0.013391276,0.002098589,0.003943132,0.00429087,0.00042386737],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005624347,0.0014092891,0.002243691,0.018309854,0.0014826265,0.0063368645,0.0023861625,0.0026655027,0.0016372373],"category_scores_gemma":[0.025800465,0.0008612662,0.0021229773,0.017204832,0.0010490472,0.008512229,0.002439776,0.0025159854,0.0021084924],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0011666843,0.0013170308,0.15553445,0.0019444618,0.00129095,0.0026521862,0.0019203635,0.0076748533,0.026878253,0.006253668,0.012799397,0.7805677],"study_design_scores_gemma":[0.00045286698,0.0012624696,0.15156224,0.0022500523,0.0072406153,0.0065847,0.010087838,0.4500056,0.11694818,0.17147556,0.08161869,0.00051130186],"about_ca_topic_score_codex":0.0024273584,"about_ca_topic_score_gemma":0.0030262507,"teacher_disagreement_score":0.018309854,"about_ca_system_score_codex":0.0010287919,"about_ca_system_score_gemma":0.0018959047,"threshold_uncertainty_score":0.029744804},"labels":[],"label_agreement":null},{"id":"W2161479324","doi":"10.1007/s10618-006-0051-9","title":"Privacy-preserving boosting","year":2007,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Privacy-Preserving Technologies in Data","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Montréal","funders":"","keywords":"Boosting (machine learning); AdaBoost; Computer science; Artificial intelligence; Classifier (UML); Machine learning; Generalization; Bipartite graph; Data mining; Pattern recognition (psychology); Theoretical computer science; Mathematics","score_opus":0.0657895914618925,"score_gpt":0.3222549855121698,"score_spread":0.2564653940502773,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2161479324","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.024312591,0.0010787228,0.9609758,0.0012395354,0.00024230381,0.000103276536,0.00028416316,0.0011437036,0.010619754],"genre_scores_gemma":[0.72554654,0.00097394636,0.25547555,0.0009889362,0.0006337221,0.0001842315,0.00077145634,0.0002834548,0.015142163],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9963672,0.0014381488,0.00014474399,0.0006899037,0.0009867486,0.0003730948],"domain_scores_gemma":[0.99292254,0.0026287655,0.00026265462,0.0031552196,0.00081738876,0.00021332907],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0040602167,0.0007476427,0.0018952868,0.00089710514,0.0012559323,0.0020636958,0.0017083365,0.0013665843,0.003865052],"category_scores_gemma":[0.013237856,0.0005508712,0.0012177391,0.0013045545,0.0015039021,0.002571899,0.002429253,0.0025141716,0.0014216135],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000744598,0.0003130811,0.0035436852,0.00026458225,0.00025260754,0.00021564424,0.0002486938,0.147548,0.009935724,0.345478,0.026688943,0.4647664],"study_design_scores_gemma":[0.000066889814,0.0001573737,0.0007364447,0.000031640357,0.00008724734,0.0004373708,0.000034723096,0.61996573,0.008300797,0.3552824,0.014876525,0.000022880284],"about_ca_topic_score_codex":0.00063534535,"about_ca_topic_score_gemma":0.0006513648,"teacher_disagreement_score":0.0040602167,"about_ca_system_score_codex":0.0007558589,"about_ca_system_score_gemma":0.0017079056,"threshold_uncertainty_score":0.021472752},"labels":[],"label_agreement":null},{"id":"W2282861635","doi":"10.1007/s10618-015-0444-8","title":"On the evaluation of unsupervised outlier detection: measures, datasets, and an empirical study","year":2016,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":732,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Conselho Nacional de Desenvolvimento Científico e Tecnológico; Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada; Fundação de Amparo à Pesquisa do Estado de São Paulo; Teknologi og Produktion, Det Frie Forskningsråd","keywords":"Outlier; Anomaly detection; Benchmark (surveying); Computer science; Data mining; Artificial intelligence; Ground truth; Pattern recognition (psychology); Set (abstract data type); Machine learning","score_opus":0.15532021060375845,"score_gpt":0.3896393330565236,"score_spread":0.23431912245276515,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2282861635","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":"methods","model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":"methods","domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.79780865,0.0054050526,0.18678454,0.0009972693,0.00030568254,0.00045342091,0.0034126097,0.0016842735,0.0031483765],"genre_scores_gemma":[0.9221168,0.0006867843,0.070075,0.00014896003,0.00011617448,0.00017005183,0.0060582496,0.00017339454,0.00045468102],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.94542366,0.02698848,0.006062921,0.0050605163,0.015502291,0.00096212997],"domain_scores_gemma":[0.658196,0.27460694,0.017886227,0.022111516,0.025251886,0.0019475559],"candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.03498443,0.0017102316,0.0016511352,0.00700916,0.0014417019,0.0030512244,0.0028106503,0.002473269,0.0006181667],"category_scores_gemma":[0.18735564,0.00036788103,0.0013873323,0.005792591,0.0022156802,0.005608084,0.0025984652,0.0017590482,0.00024108909],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.006365941,0.004265401,0.3466473,0.002784813,0.003256323,0.00041744698,0.0016084318,0.18952799,0.009163713,0.011655854,0.015000794,0.40930596],"study_design_scores_gemma":[0.00038321325,0.0043150834,0.075095475,0.00039356895,0.00088655687,0.0015282915,0.0014021716,0.8831693,0.012946387,0.015224966,0.0044422937,0.00021276023],"about_ca_topic_score_codex":0.004075689,"about_ca_topic_score_gemma":0.0049331607,"teacher_disagreement_score":0.9650156,"about_ca_system_score_codex":0.0021098466,"about_ca_system_score_gemma":0.0018210539,"threshold_uncertainty_score":0.18501753},"labels":[],"label_agreement":null},{"id":"W2470642288","doi":"10.1007/s10618-016-0475-9","title":"Ensembles of label noise filters: a ranking approach","year":2016,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Dalhousie University","funders":"Fundação de Amparo à Pesquisa do Estado de São Paulo","keywords":"Computer science; Noise (video); Machine learning; Artificial intelligence; Filter (signal processing); Ranking (information retrieval); Ensemble learning; Process (computing); Data mining; Noise measurement; Pattern recognition (psychology); Noise reduction","score_opus":0.06737345868108362,"score_gpt":0.3006821942314548,"score_spread":0.23330873555037118,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2470642288","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.011380495,0.0008137513,0.9847937,0.0003336211,0.00013245098,0.00008978421,0.00014506912,0.0008310222,0.0014800591],"genre_scores_gemma":[0.32207125,0.0010379764,0.66347116,0.00055942027,0.00085545593,0.00036490697,0.0015559999,0.0006171654,0.009466656],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9918705,0.0032939224,0.00046804157,0.0012008891,0.002518838,0.00064782583],"domain_scores_gemma":[0.9751174,0.0130349975,0.0011968979,0.003335915,0.0065304334,0.00078436563],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0113913715,0.0020178526,0.004516779,0.005171672,0.0017235711,0.0043981955,0.003970265,0.0040509296,0.004067419],"category_scores_gemma":[0.028452748,0.0010318672,0.002121395,0.0035348616,0.0011130621,0.0046375496,0.0022076713,0.0028488461,0.0019386397],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00093385525,0.00085499993,0.007824241,0.00045782005,0.0010805934,0.00015985701,0.00026519952,0.18175894,0.009058356,0.04750815,0.018392183,0.7317058],"study_design_scores_gemma":[0.00005608365,0.0003088283,0.0012549623,0.000060214716,0.00027883713,0.00010447511,0.00008531004,0.9445593,0.003973937,0.045710694,0.003547602,0.000059772563],"about_ca_topic_score_codex":0.0044389353,"about_ca_topic_score_gemma":0.0078022,"teacher_disagreement_score":0.0113913715,"about_ca_system_score_codex":0.0015806057,"about_ca_system_score_gemma":0.0024781558,"threshold_uncertainty_score":0.060244024},"labels":[],"label_agreement":null},{"id":"W2545851563","doi":"10.1007/s10618-016-0481-y","title":"Multiple Bayesian discriminant functions for high-dimensional massive data classification","year":2016,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Face and Expression Recognition","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université de Sherbrooke","funders":"Université Pierre et Marie Curie; Natural Sciences and Engineering Research Council of Canada; National Natural Science Foundation of China","keywords":"Artificial intelligence; Pattern recognition (psychology); Weighting; Naive Bayes classifier; Machine learning; Computer science; Linear discriminant analysis; Discriminant; Bayesian probability; Classifier (UML); Bayesian inference; Feature (linguistics); Clustering high-dimensional data; Data mining; Mathematics; Support vector machine; Cluster analysis","score_opus":0.09958120661649893,"score_gpt":0.30668627265241966,"score_spread":0.20710506603592072,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2545851563","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.006363886,0.00089245796,0.99112844,0.00039550304,0.000052076295,0.000035464418,0.00021350566,0.0006317725,0.00028688685],"genre_scores_gemma":[0.22347498,0.001134077,0.77018535,0.00027783457,0.00034174332,0.00042273547,0.0014551259,0.00017829092,0.0025297862],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.99684876,0.0012952127,0.00025078747,0.0004791727,0.0009120027,0.00021411279],"domain_scores_gemma":[0.99252653,0.0047547715,0.00044967755,0.0011806673,0.00086789945,0.00022045204],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004874636,0.0011857338,0.0029473337,0.0028370586,0.0012770194,0.0019068879,0.0027534056,0.0017751312,0.0020128377],"category_scores_gemma":[0.017747335,0.00086731877,0.0014789841,0.0033284018,0.0010762301,0.002652093,0.003052948,0.0033046266,0.0016813002],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.000317114,0.00030285734,0.0037761582,0.0002740857,0.00025407798,0.00013084797,0.00015787478,0.21328717,0.0031697312,0.04055574,0.011318442,0.7264558],"study_design_scores_gemma":[0.000013620056,0.000016668779,0.00048177107,0.000016938848,0.000015617155,0.000035204375,0.000023942295,0.9545681,0.0005560768,0.043141875,0.0011148663,0.000015383761],"about_ca_topic_score_codex":0.0037328922,"about_ca_topic_score_gemma":0.004748477,"teacher_disagreement_score":0.004874636,"about_ca_system_score_codex":0.0010339589,"about_ca_system_score_gemma":0.001680133,"threshold_uncertainty_score":0.025779843},"labels":[],"label_agreement":null},{"id":"W2755646241","doi":"10.1007/s10618-017-0540-z","title":"Bounding the difference between RankRC and RankSVM and application to multi-level rare class kernel ranking","year":2017,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Machine Learning and ELM","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Waterloo","funders":"Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada","keywords":"Kernel method; Kernel (algebra); Computer science; Bounding overwatch; Mathematics; Projection (relational algebra); Algorithm; Support vector machine; Machine learning; Artificial intelligence; Combinatorics","score_opus":0.08877169197371115,"score_gpt":0.3433036432579842,"score_spread":0.25453195128427303,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2755646241","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0341565,0.0024181043,0.955542,0.0013013412,0.00032856106,0.00007412585,0.00017595799,0.0028728794,0.0031305174],"genre_scores_gemma":[0.5677587,0.00057977135,0.42282185,0.0004097354,0.00040142582,0.00017948149,0.00052189024,0.00081645313,0.0065107625],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99118644,0.0033229375,0.0003973824,0.0011150091,0.0031012702,0.0008769611],"domain_scores_gemma":[0.96969134,0.020900642,0.0012838311,0.0033578877,0.003907166,0.0008590836],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008853575,0.0012601832,0.002535643,0.0019868077,0.0009590298,0.0040674075,0.0037534623,0.0030626245,0.0045445003],"category_scores_gemma":[0.054913774,0.0005787666,0.0007928012,0.0015618013,0.0018966844,0.004606394,0.0044144765,0.0038960178,0.0014732246],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0012559803,0.0004879934,0.0044415216,0.0005013533,0.0001681056,0.00029328538,0.0002708901,0.40097654,0.011645803,0.16007714,0.019501757,0.40037957],"study_design_scores_gemma":[0.000012697626,0.000035020672,0.00024638063,0.0000115686535,0.000007531867,0.000050182738,0.000014276133,0.9816127,0.0012933692,0.01596061,0.00074363203,0.000012022397],"about_ca_topic_score_codex":0.0043321373,"about_ca_topic_score_gemma":0.007375269,"teacher_disagreement_score":0.008853575,"about_ca_system_score_codex":0.0023826996,"about_ca_system_score_gemma":0.003570604,"threshold_uncertainty_score":0.046822727},"labels":[],"label_agreement":null},{"id":"W2810490377","doi":"10.1007/s10618-020-00677-w","title":"Model-based exception mining for object-relational data","year":2020,"lang":"en","type":"preprint","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Object (grammar); Outlier; Data mining; Metric (unit); Bayesian network; Probabilistic logic; Relational model; Representation (politics); Relational database; Population; Statistical relational learning; Artificial intelligence; Object model; Graphical model; Data modeling; Statistical model; Database","score_opus":0.20507464499303893,"score_gpt":0.3555595803813095,"score_spread":0.1504849353882706,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2810490377","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.02940197,0.00043785662,0.9637769,0.00037507463,0.00011548149,0.00015448092,0.00076100527,0.0041252016,0.00085201196],"genre_scores_gemma":[0.40286344,0.00039632103,0.5919204,0.00024542102,0.000094709,0.00016690887,0.0026015434,0.0004353208,0.0012759916],"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9947812,0.0011412255,0.0006910452,0.00090955716,0.0020674623,0.00040956232],"domain_scores_gemma":[0.9861572,0.005290629,0.0013811648,0.004974446,0.0018241201,0.00037241],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0043520927,0.0009239136,0.0020815749,0.0031849092,0.001252931,0.0045027575,0.0034027402,0.0012317377,0.0011720028],"category_scores_gemma":[0.020668542,0.0006942317,0.002827458,0.0034338036,0.0011388735,0.004864201,0.0026993335,0.0022727198,0.0006219551],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.001143259,0.0007880978,0.043255545,0.00086569315,0.00091341033,0.001157801,0.0007056828,0.26926586,0.011563134,0.07025283,0.017515382,0.5825733],"study_design_scores_gemma":[0.00003735269,0.00009593097,0.0010558754,0.000050687282,0.0001473558,0.0003921858,0.000114504335,0.9068093,0.007525007,0.08075069,0.002988164,0.00003290628],"about_ca_topic_score_codex":0.004516327,"about_ca_topic_score_gemma":0.007145752,"teacher_disagreement_score":0.004516327,"about_ca_system_score_codex":0.0008890066,"about_ca_system_score_gemma":0.0026151366,"threshold_uncertainty_score":0.023016334},"labels":[],"label_agreement":null},{"id":"W2884063665","doi":"10.1007/s10618-018-0578-6","title":"Extreme-value-theoretic estimation of local intrinsic dimensionality","year":2018,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Statistical Mechanics and Entropy","field":"Physics and Astronomy","cited_by":52,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Google (Canada)","funders":"","keywords":"Curse of dimensionality; Discriminative model; Estimator; Outlier; Measure (data warehouse); Intrinsic dimension; Extreme value theory; Mathematics; Random variable; Similarity measure; Similarity (geometry); Dimension (graph theory); Pattern recognition (psychology); Artificial intelligence; Computer science; Data mining; Statistics","score_opus":0.037199048151490686,"score_gpt":0.3063922545785057,"score_spread":0.26919320642701505,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2884063665","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.028072087,0.00036063994,0.97012657,0.00046634817,0.000021947042,0.000012727012,0.00008478038,0.0000753368,0.0007795991],"genre_scores_gemma":[0.86386013,0.0009614605,0.13217565,0.00017478231,0.00034608284,0.00011035459,0.000517332,0.00006842877,0.0017856825],"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9978435,0.0011502441,0.00010988478,0.00034046805,0.00044506308,0.00011074398],"domain_scores_gemma":[0.98386127,0.012194758,0.0011469994,0.0014403936,0.0009565104,0.00040002292],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005411464,0.0006044334,0.0013899489,0.0021316195,0.00054221624,0.0024836846,0.0017786184,0.001162464,0.00095375796],"category_scores_gemma":[0.02922844,0.00049909146,0.00085746427,0.0013012164,0.0029369101,0.0045676595,0.0030301649,0.002298801,0.0002262533],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00018771255,0.00015345671,0.007792904,0.00030600725,0.0002650622,0.00014493591,0.00024156351,0.46963248,0.0035090682,0.4427658,0.002182453,0.072818644],"study_design_scores_gemma":[0.000006814769,0.000024735362,0.0008695321,0.000019058598,0.000010088409,0.000042646287,0.000024932122,0.76575273,0.0006212773,0.23230864,0.0003029045,0.000016667542],"about_ca_topic_score_codex":0.0006108496,"about_ca_topic_score_gemma":0.00052159576,"teacher_disagreement_score":0.005411464,"about_ca_system_score_codex":0.0010901806,"about_ca_system_score_gemma":0.0011241196,"threshold_uncertainty_score":0.028618872},"labels":[],"label_agreement":null},{"id":"W2894980798","doi":"10.1007/s10618-018-0592-8","title":"Classification with label noise: a Markov chain sampling framework","year":2018,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":13,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Australian Research Council","keywords":"Markov chain; Computer science; Probabilistic logic; Correctness; Artificial intelligence; Noise (video); Markov chain Monte Carlo; Pattern recognition (psychology); Sampling (signal processing); Machine learning; Probability distribution; Variable-order Markov model; Hidden Markov model; Algorithm; Markov model; Bayesian probability; Mathematics; Statistics","score_opus":0.0757148656264769,"score_gpt":0.33957449440473064,"score_spread":0.26385962877825375,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2894980798","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.010731521,0.0002918735,0.9872181,0.0006165838,0.00006886005,0.00016374416,0.00012999092,0.00023620795,0.00054310064],"genre_scores_gemma":[0.5377534,0.001184787,0.4467075,0.0009876913,0.0010572381,0.0016509134,0.0019337669,0.00041148072,0.008313198],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.988277,0.006926228,0.00042673064,0.0019091793,0.0018147307,0.00064610696],"domain_scores_gemma":[0.9125906,0.07676171,0.0022040547,0.0047339043,0.0026010985,0.0011084744],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.028962271,0.0014395727,0.0050314544,0.003985937,0.0024663752,0.0051371804,0.00784435,0.0054105297,0.0050202375],"category_scores_gemma":[0.06281885,0.0023103082,0.0035878702,0.003514089,0.0056420825,0.0079989415,0.004813591,0.0055095456,0.001145473],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006115454,0.0004234712,0.0052632256,0.00027525632,0.00037842727,0.00034989777,0.0006337821,0.5302946,0.00094680977,0.38833216,0.004813729,0.06767718],"study_design_scores_gemma":[0.000034590492,0.000019526171,0.00011183936,0.00001706898,0.000025517958,0.000023118591,0.000011861873,0.92917985,0.00013437743,0.07015195,0.00027808413,0.000012206691],"about_ca_topic_score_codex":0.00917977,"about_ca_topic_score_gemma":0.008347616,"teacher_disagreement_score":0.028962271,"about_ca_system_score_codex":0.0034155142,"about_ca_system_score_gemma":0.0032488327,"threshold_uncertainty_score":0.15316898},"labels":[],"label_agreement":null},{"id":"W2950515936","doi":"10.1007/s10618-017-0497-y","title":"Adjusting for scorekeeper bias in NBA box scores","year":2017,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Sports Analytics and Performance","field":"Economics, Econometrics and Finance","cited_by":12,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"","keywords":"Statistics; Popularity; Basketball; Computer science; Generosity; Econometrics; Psychology; Mathematics; Geography; Social psychology","score_opus":0.24888413932482473,"score_gpt":0.33297201709110424,"score_spread":0.08408787776627952,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2950515936","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.46783558,0.0027051931,0.48437172,0.0058732377,0.0030451177,0.0005180905,0.011047596,0.0046151984,0.019988317],"genre_scores_gemma":[0.90948355,0.00017005067,0.07022471,0.0012043942,0.0004140549,0.00027421227,0.004269942,0.00062573364,0.013333361],"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.95872873,0.023089103,0.0031606047,0.0074710944,0.0053699184,0.0021806716],"domain_scores_gemma":[0.81927496,0.115588896,0.012511001,0.03347846,0.016208762,0.002937843],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.066163234,0.0010567614,0.0019491322,0.0020102542,0.001739323,0.0033698156,0.003788523,0.0019203621,0.008872538],"category_scores_gemma":[0.23823674,0.00053848454,0.0023534333,0.0038985354,0.0015306546,0.002870517,0.0018811543,0.0032153453,0.0031134703],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0015975983,0.00031275515,0.7374026,0.00037649565,0.006069344,0.0004728929,0.0009089806,0.025298873,0.0025441987,0.024440998,0.04988135,0.15069395],"study_design_scores_gemma":[0.0007366116,0.000824332,0.51574296,0.0004969796,0.0053033535,0.00074291055,0.0016035386,0.2851343,0.015378446,0.099777035,0.07401,0.00024960694],"about_ca_topic_score_codex":0.037237547,"about_ca_topic_score_gemma":0.040982,"teacher_disagreement_score":0.066163234,"about_ca_system_score_codex":0.0014364873,"about_ca_system_score_gemma":0.0039192163,"threshold_uncertainty_score":0.34990883},"labels":[],"label_agreement":null},{"id":"W2969639627","doi":"10.1007/s10618-019-00651-1","title":"A unified view of density-based methods forsemi-supervised clustering and classification","year":2019,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":28,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Conselho Nacional de Desenvolvimento Científico e Tecnológico; Natural Sciences and Engineering Research Council of Canada; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior","keywords":"Cluster analysis; Computer science; Artificial intelligence; Semi-supervised learning; Supervised learning; Graph; Machine learning; Correlation clustering; Data stream clustering; Data mining; Pattern recognition (psychology); CURE data clustering algorithm; Artificial neural network; Theoretical computer science","score_opus":0.09721739508829468,"score_gpt":0.386530902237729,"score_spread":0.2893135071494343,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W2969639627","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.00040294402,0.00034780693,0.9983767,0.00021542404,0.00002926632,0.000024739753,0.000022183047,0.00007569274,0.00050524477],"genre_scores_gemma":[0.0800152,0.0022903266,0.913923,0.0004141931,0.0006461876,0.0004792611,0.00034593735,0.00016759719,0.0017182849],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9917488,0.003681258,0.00041906704,0.0013056166,0.0026390848,0.0002061383],"domain_scores_gemma":[0.988817,0.005699157,0.0006955759,0.0019280101,0.0025378114,0.00032249116],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008548399,0.0016479761,0.002592206,0.005399259,0.0017634814,0.0049750106,0.004579043,0.0027045128,0.0016686392],"category_scores_gemma":[0.018012038,0.0011979692,0.0021555761,0.0044396985,0.004903835,0.0067162453,0.0047688065,0.005066001,0.001331289],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00006104752,0.00010082028,0.0013056955,0.00053831417,0.00023414181,0.00014088054,0.0005996998,0.14472307,0.0028968533,0.663209,0.0057146586,0.18047583],"study_design_scores_gemma":[0.000013538476,0.000054745247,0.00044203197,0.00008716229,0.00004147612,0.00020253203,0.00011335389,0.64480215,0.0017313062,0.34208295,0.010363308,0.000065412096],"about_ca_topic_score_codex":0.0027986583,"about_ca_topic_score_gemma":0.0025412743,"teacher_disagreement_score":0.008548399,"about_ca_system_score_codex":0.002352287,"about_ca_system_score_gemma":0.0022640678,"threshold_uncertainty_score":0.045208752},"labels":[],"label_agreement":null},{"id":"W3043874967","doi":"10.1007/s10618-020-00705-9","title":"Deep soccer analytics: learning an action-value function for evaluating soccer players","year":2020,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Sports Analytics and Performance","field":"Economics, Econometrics and Finance","cited_by":104,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada","keywords":"Artificial intelligence; Computer science; Analytics; Value (mathematics); Action (physics); Function (biology); Machine learning; Data mining","score_opus":0.25603027818386753,"score_gpt":0.3534881577537748,"score_spread":0.09745787956990726,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3043874967","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.37141517,0.0014725071,0.6124872,0.0019935772,0.00018355531,0.0001878274,0.0040946086,0.0026151305,0.0055504204],"genre_scores_gemma":[0.95754516,0.00029267557,0.037499897,0.0001345062,0.00006437733,0.00008704273,0.0018942213,0.00004598638,0.0024359971],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9995926,0.00011300733,0.000021683321,0.00012143148,0.00007229386,0.000078983976],"domain_scores_gemma":[0.99902415,0.0005040431,0.00011853615,0.00007955667,0.00015319732,0.00012062027],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0011202764,0.001102587,0.00081411446,0.0012436996,0.00026788504,0.0010743011,0.001063214,0.0011279554,0.0029937013],"category_scores_gemma":[0.0036715495,0.00029868685,0.000556568,0.0009973476,0.00041837012,0.0012675758,0.0011790656,0.0014688203,0.00074517104],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0010593691,0.0012037368,0.05778038,0.00017773158,0.000330985,0.00010452447,0.00014598151,0.3711831,0.0036258227,0.010875,0.01353667,0.5399767],"study_design_scores_gemma":[0.000013764808,0.000069222086,0.0031777227,0.000016812965,0.00001673423,0.0000130352655,0.00002169622,0.9846789,0.0007260299,0.010831307,0.0004263553,0.000008396543],"about_ca_topic_score_codex":0.0090376055,"about_ca_topic_score_gemma":0.012871663,"teacher_disagreement_score":0.0090376055,"about_ca_system_score_codex":0.0008873035,"about_ca_system_score_gemma":0.0013741879,"threshold_uncertainty_score":0.017970026},"labels":[],"label_agreement":null},{"id":"W3097249106","doi":"10.1007/s10618-020-00720-w","title":"An exemplar-based clustering using efficient variational message passing","year":2020,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Université du Québec en Outaouais","funders":"","keywords":"Cluster analysis; Computer science; Correlation clustering; Message passing; Affinity propagation; Constrained clustering; Graph partition; CURE data clustering algorithm; Canopy clustering algorithm; Data mining; Graph; Theoretical computer science; Artificial intelligence","score_opus":0.1118581280584065,"score_gpt":0.3593757391597357,"score_spread":0.2475176111013292,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3097249106","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.003207884,0.0000544327,0.9959266,0.000079922815,0.000031146872,0.000033347365,0.00002178038,0.00024533653,0.00039962397],"genre_scores_gemma":[0.12414245,0.0001354405,0.87103724,0.0001414105,0.00007982337,0.00019110575,0.00030125282,0.00022236051,0.0037489664],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984395,0.00045574832,0.00008758149,0.00033775766,0.00052023074,0.00015914835],"domain_scores_gemma":[0.99782526,0.0009211592,0.00012869295,0.0003438941,0.00062335114,0.00015769037],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002456837,0.0010115693,0.0027719198,0.0016696809,0.0016264725,0.0019439452,0.0051489137,0.0029759647,0.0033931711],"category_scores_gemma":[0.0057723215,0.0012358003,0.0018201581,0.0022361905,0.0016322386,0.002377099,0.0039469865,0.0023200943,0.0013890556],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00021721917,0.00017541088,0.00076049316,0.00015764857,0.00018497088,0.00009706475,0.00025023718,0.71175194,0.010414481,0.059464842,0.0038758772,0.21264975],"study_design_scores_gemma":[0.000006555282,0.000014628227,0.000036553432,0.0000026696187,0.000007160662,0.00001692642,0.000007862978,0.9942445,0.00081754714,0.004456814,0.0003811786,0.000007607154],"about_ca_topic_score_codex":0.012127617,"about_ca_topic_score_gemma":0.010142283,"teacher_disagreement_score":0.012127617,"about_ca_system_score_codex":0.0016930373,"about_ca_system_score_gemma":0.0024052775,"threshold_uncertainty_score":0.024114013},"labels":[],"label_agreement":null},{"id":"W3099831365","doi":"10.1007/s10618-015-0426-x","title":"Generalization of clustering agreements and distances for overlapping clusters and network communities","year":2015,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Cluster analysis; Generalization; Measure (data warehouse); Context (archaeology); Single-linkage clustering; Correlation clustering; Rand index; Contingency table; Cluster (spacecraft)","score_opus":0.11934352232843241,"score_gpt":0.3518487569469944,"score_spread":0.23250523461856198,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3099831365","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.067917116,0.00080797845,0.92451406,0.00071998156,0.00008862452,0.00014934414,0.00052093726,0.00032314836,0.004958825],"genre_scores_gemma":[0.61918485,0.0014276869,0.37161818,0.0003080779,0.00039056534,0.000517234,0.0017550678,0.00030885334,0.0044894787],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","domain_scores_codex":[0.9907832,0.0029701374,0.0006410959,0.0028553223,0.002322295,0.00042790643],"domain_scores_gemma":[0.9243514,0.046606857,0.007830225,0.010204546,0.008800325,0.0022067174],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0154444,0.0013222119,0.0021929876,0.0077506215,0.0030832775,0.004336335,0.005461771,0.002765425,0.0035253793],"category_scores_gemma":[0.11074733,0.0011080271,0.0020739539,0.006505052,0.0046343985,0.012689646,0.0053320765,0.0049826265,0.00087042095],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00022085573,0.00017772354,0.010066546,0.0003943261,0.00021127627,0.00022656737,0.0022202113,0.11215893,0.0014645912,0.76793283,0.00482158,0.10010457],"study_design_scores_gemma":[0.000020949767,0.000046067715,0.002209862,0.00006790943,0.000052176725,0.00024625383,0.00042439668,0.29192472,0.0005645145,0.70205647,0.002345444,0.00004130535],"about_ca_topic_score_codex":0.003681614,"about_ca_topic_score_gemma":0.0029549778,"teacher_disagreement_score":0.0154444,"about_ca_system_score_codex":0.0032262604,"about_ca_system_score_gemma":0.0017886839,"threshold_uncertainty_score":0.08167875},"labels":[],"label_agreement":null},{"id":"W3141059875","doi":"10.1007/s10618-005-1355-x","title":"Mining Customer Value: From Association Rules to Direct Marketing","year":2005,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Consumer Market Behavior and Pricing","field":"Business, Management and Accounting","cited_by":117,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Simon Fraser University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Association rule learning; Profit (economics); Computer science; Data mining; Liberian dollar; Direct marketing; Customer lifetime value; Customer value; Marketing; Artificial intelligence; Machine learning; Customer retention; Business; Economics; Finance","score_opus":0.030811306805708635,"score_gpt":0.2724500237614445,"score_spread":0.24163871695573585,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3141059875","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.72877944,0.00789167,0.2405359,0.0030621467,0.00033290524,0.00043791358,0.008463337,0.0026337686,0.0078628715],"genre_scores_gemma":[0.8699178,0.0017030757,0.11560295,0.00039995683,0.0003359499,0.00023747854,0.009897125,0.0000994978,0.0018060395],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9979576,0.0005599029,0.00020794854,0.0004626282,0.00067112595,0.00014082933],"domain_scores_gemma":[0.9871471,0.010545319,0.00067064876,0.0006104533,0.0007965648,0.0002300155],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0020880387,0.0011161552,0.0012991757,0.008165473,0.00072166015,0.00251613,0.0017823677,0.0014371948,0.0012821028],"category_scores_gemma":[0.01577572,0.0005571874,0.001514751,0.0061430098,0.00065881957,0.0023113636,0.0010334448,0.0019289459,0.0010943536],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00089676376,0.002187593,0.19418445,0.00057656725,0.0012839583,0.0015141139,0.0005800849,0.03053873,0.0034350234,0.0057664206,0.013333119,0.7457032],"study_design_scores_gemma":[0.0002877536,0.00052240904,0.060435943,0.00032401204,0.0016501835,0.002157105,0.0010899382,0.8033013,0.008595553,0.109549716,0.011972292,0.00011374164],"about_ca_topic_score_codex":0.004753905,"about_ca_topic_score_gemma":0.0059389323,"teacher_disagreement_score":0.008165473,"about_ca_system_score_codex":0.0005341206,"about_ca_system_score_gemma":0.0010468573,"threshold_uncertainty_score":0.011042714},"labels":[],"label_agreement":null},{"id":"W3199460270","doi":"10.1007/s10618-021-00794-0","title":"A Lagrangian-based score for assessing the quality of pairwise constraints in semi-supervised clustering","year":2021,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Clustering Algorithms Research","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Polytechnique Montréal; Group for Research in Decision Analysis","funders":"","keywords":"Cluster analysis; Pairwise comparison; Constrained clustering; Constraint (computer-aided design); Computer science; Data mining; Machine learning; Key (lock); Artificial intelligence; Correlation clustering; Mathematics; CURE data clustering algorithm","score_opus":0.1432772631699324,"score_gpt":0.40712493858682247,"score_spread":0.2638476754168901,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W3199460270","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.044995077,0.00038777618,0.9511561,0.0004508108,0.00008828169,0.00016918727,0.0004561699,0.0005238377,0.0017727531],"genre_scores_gemma":[0.5308143,0.00022643458,0.46474674,0.0002531692,0.00017880024,0.000344751,0.0018473099,0.00023144318,0.0013569709],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.986406,0.0051641795,0.0011296603,0.001355385,0.005344044,0.0006007172],"domain_scores_gemma":[0.9651881,0.019711105,0.0038190107,0.002310764,0.0074116746,0.0015593158],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01602347,0.001441052,0.0027428286,0.0061821057,0.0017957407,0.0037484465,0.003964273,0.0037040205,0.0026334017],"category_scores_gemma":[0.052933082,0.0006531999,0.0015522134,0.0045232135,0.003716595,0.004442091,0.003937851,0.0025324335,0.00071301416],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0014164159,0.0006294053,0.031325255,0.00108296,0.001120738,0.00045871004,0.0005473424,0.60686344,0.011698918,0.06800734,0.012573553,0.2642759],"study_design_scores_gemma":[0.0000809103,0.0002673114,0.002241407,0.00005343985,0.00006120275,0.00016391127,0.00009352922,0.97109884,0.0019517784,0.023320125,0.00060281454,0.00006478135],"about_ca_topic_score_codex":0.0035882178,"about_ca_topic_score_gemma":0.0043167556,"teacher_disagreement_score":0.01602347,"about_ca_system_score_codex":0.002280107,"about_ca_system_score_gemma":0.0036066724,"threshold_uncertainty_score":0.084741235},"labels":[],"label_agreement":null},{"id":"W4239981520","doi":"10.1007/s10618-009-0144-3","title":"Fast incremental mining of web sequential patterns with PLWAP tree","year":2009,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Windsor","funders":"","keywords":"Computer science; Data mining; Tree (set theory); Web mining; Information retrieval; World Wide Web; Mathematics; Web service","score_opus":0.0352025202348579,"score_gpt":0.2851548256075449,"score_spread":0.249952305372687,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4239981520","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10378817,0.0011707183,0.8797337,0.00032760898,0.00016238498,0.00044847245,0.003385322,0.008791653,0.0021921282],"genre_scores_gemma":[0.27908906,0.00044870545,0.7112548,0.00009837242,0.00007398587,0.00030447874,0.0062989187,0.00024229714,0.0021894085],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9991241,0.00011004627,0.00009772813,0.00016554123,0.00041132915,0.00009108273],"domain_scores_gemma":[0.997486,0.0010919488,0.00020693097,0.00040751306,0.0006813127,0.00012624695],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008474107,0.0005587126,0.00096313574,0.003480332,0.0007403493,0.0011950828,0.0015350919,0.00059853814,0.0018568397],"category_scores_gemma":[0.0055308226,0.00054113485,0.0009366437,0.003947287,0.00026154966,0.0022466916,0.0010791122,0.00080368377,0.0011561778],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00061900495,0.00029772156,0.014442552,0.0005609684,0.0001986943,0.0008946408,0.0002249265,0.020826148,0.017367166,0.004538511,0.014292613,0.9257371],"study_design_scores_gemma":[0.00011608323,0.00028011124,0.0050521344,0.00005567854,0.00018734107,0.0014392851,0.0001957757,0.9434766,0.0155340005,0.021471404,0.012157874,0.00003369222],"about_ca_topic_score_codex":0.0031526694,"about_ca_topic_score_gemma":0.005857447,"teacher_disagreement_score":0.003480332,"about_ca_system_score_codex":0.0002513818,"about_ca_system_score_gemma":0.0011770187,"threshold_uncertainty_score":0.0062686205},"labels":[],"label_agreement":null},{"id":"W4283736551","doi":"10.1007/s10618-022-00843-2","title":"VPint: value propagation-based spatial interpolation","year":2022,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Image Processing Techniques","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of British Columbia","funders":"Horizon 2020; Nederlandse Organisatie voor Wetenschappelijk Onderzoek","keywords":"Interpolation (computer graphics); Multivariate interpolation; Value (mathematics); Computer science; Mathematics; Algorithm; Bilinear interpolation; Artificial intelligence; Statistics","score_opus":0.031453118059549263,"score_gpt":0.30222898437326057,"score_spread":0.2707758663137113,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4283736551","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.009070682,0.00024918234,0.98710585,0.00016067905,0.00006606719,0.000051930765,0.00021470865,0.002500392,0.0005804752],"genre_scores_gemma":[0.28448644,0.00038591417,0.71057063,0.00023139983,0.00009974856,0.00019774093,0.0014106869,0.00039749892,0.0022199252],"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","domain_scores_codex":[0.998276,0.00046711537,0.00012756739,0.00038242174,0.0005903445,0.00015656138],"domain_scores_gemma":[0.9946201,0.002736199,0.00045257315,0.0009780877,0.001006938,0.00020615077],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0037940936,0.0010894035,0.0015315287,0.0018365084,0.0006742831,0.00132737,0.0040948684,0.0011078665,0.0020428095],"category_scores_gemma":[0.014025779,0.0007077931,0.0015000842,0.0030378539,0.00091992476,0.002967392,0.0033445517,0.0029156476,0.00071924366],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003721181,0.00023380017,0.005047313,0.00023676759,0.00016855619,0.0001805132,0.00031156398,0.5564292,0.0032990957,0.018191943,0.006415864,0.4091133],"study_design_scores_gemma":[0.00001789934,0.00003770056,0.00019651298,0.000010508469,0.000011955048,0.00003275897,0.000020264162,0.98828214,0.00118719,0.008984528,0.0012073187,0.00001127078],"about_ca_topic_score_codex":0.013225,"about_ca_topic_score_gemma":0.013101626,"teacher_disagreement_score":0.013225,"about_ca_system_score_codex":0.0012516237,"about_ca_system_score_gemma":0.0027673603,"threshold_uncertainty_score":0.02629602},"labels":[],"label_agreement":null},{"id":"W4376956106","doi":"10.1007/s10618-023-00931-x","title":"On the evaluation of outlier detection and one-class classification: a comparative study of algorithms, model selection, and ensembles","year":2023,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":29,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Natural Sciences and Engineering Research Council of Canada; Danmarks Frie Forskningsfond; Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada","keywords":"Anomaly detection; Outlier; Artificial intelligence; Machine learning; One-class classification; Computer science; Class (philosophy); Selection (genetic algorithm); Pattern recognition (psychology); Support vector machine; Focus (optics); Data mining","score_opus":0.27070642898415714,"score_gpt":0.3888650291681965,"score_spread":0.11815860018403934,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4376956106","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.3847287,0.041650396,0.5573995,0.0018812023,0.0010852795,0.00079747016,0.0015499339,0.0036121567,0.0072953235],"genre_scores_gemma":[0.7526343,0.0039135767,0.23608948,0.000557973,0.00054493634,0.00045660388,0.004129233,0.0006236225,0.0010502324],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.96188843,0.019015986,0.0028572264,0.004973297,0.010454839,0.0008102549],"domain_scores_gemma":[0.8621141,0.10232044,0.007322048,0.013413644,0.01349314,0.0013365969],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04101722,0.003863413,0.0045732413,0.0087099355,0.0014220346,0.0033660044,0.0030987407,0.0038317775,0.00082396256],"category_scores_gemma":[0.09605254,0.0006378058,0.002631884,0.0062866188,0.0018796212,0.0058921915,0.003514807,0.003190109,0.00054357434],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0021565002,0.0010576445,0.039309025,0.0017446134,0.0033613092,0.00018046582,0.00073042815,0.46523464,0.0039658435,0.008263889,0.0085894605,0.46540627],"study_design_scores_gemma":[0.000111870264,0.0019956874,0.015893346,0.00029481566,0.00046530803,0.00042559943,0.00042498557,0.9605491,0.007019425,0.009382459,0.0032688263,0.000168507],"about_ca_topic_score_codex":0.0047843726,"about_ca_topic_score_gemma":0.003499206,"teacher_disagreement_score":0.04101722,"about_ca_system_score_codex":0.0021871575,"about_ca_system_score_gemma":0.0018539407,"threshold_uncertainty_score":0.2169224},"labels":[],"label_agreement":null},{"id":"W4387703477","doi":"10.1007/s10618-023-00970-4","title":"Mondrian forest for data stream classification under memory constraints","year":2023,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Stream Mining Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada; Canada Foundation for Innovation","keywords":"Mondrian; Computer science; Trimming; Data stream mining; Node (physics); Data stream; Data mining; Theoretical computer science; Machine learning; Programming language","score_opus":0.17832625361537688,"score_gpt":0.3657060325522407,"score_spread":0.18737977893686383,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4387703477","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.034623187,0.0029696543,0.9520457,0.0012680122,0.00030373954,0.00011862179,0.0013016029,0.0032107448,0.004158695],"genre_scores_gemma":[0.39800832,0.0018825375,0.5815732,0.00054659194,0.00058364694,0.00038224575,0.0039367494,0.00053000473,0.012556766],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99922335,0.00019256213,0.00007435077,0.00018206761,0.00021808894,0.000109538574],"domain_scores_gemma":[0.9974898,0.0012990283,0.00014532625,0.00058719673,0.00036580514,0.000112856964],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018006329,0.0005910813,0.0015883838,0.0015463348,0.0010899594,0.001672622,0.0023596,0.001176492,0.0048609637],"category_scores_gemma":[0.009726363,0.00053692854,0.0010176285,0.002088959,0.00066375843,0.0035056635,0.0013735553,0.0020541463,0.0011898278],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00091732916,0.00025921088,0.0041421684,0.00040133263,0.00016020467,0.0003565581,0.00016468544,0.16926217,0.0028239524,0.12833853,0.03451343,0.65866053],"study_design_scores_gemma":[0.000032066415,0.00003159571,0.00037955685,0.00003358449,0.000023775485,0.00010043425,0.000024636167,0.8728952,0.0006574555,0.12214807,0.0036622726,0.0000113692195],"about_ca_topic_score_codex":0.007886954,"about_ca_topic_score_gemma":0.012662713,"teacher_disagreement_score":0.007886954,"about_ca_system_score_codex":0.00084534567,"about_ca_system_score_gemma":0.00186222,"threshold_uncertainty_score":0.016261578},"labels":[],"label_agreement":null},{"id":"W4391572936","doi":"10.1007/s10618-023-01001-y","title":"VEM$$^2$$L: an easy but effective framework for fusing text and structure knowledge on sparse knowledge graph completion","year":2024,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute","funders":"National Natural Science Foundation of China","keywords":"Computer science; Knowledge graph; Graph; Information retrieval; Artificial intelligence; Theoretical computer science","score_opus":0.05877690887851249,"score_gpt":0.33299489273397936,"score_spread":0.27421798385546686,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4391572936","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.0013113485,0.000094512536,0.99481213,0.00020207449,0.00004806249,0.00006950744,0.00037006117,0.002507496,0.000584938],"genre_scores_gemma":[0.060909376,0.00016935865,0.9314928,0.00032448012,0.00012583734,0.0002848813,0.0020433706,0.0006495243,0.0040002964],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99770385,0.00087282114,0.00011203799,0.00049551,0.0006216493,0.00019408116],"domain_scores_gemma":[0.9953257,0.0023658464,0.0001862434,0.0011783816,0.00067507726,0.000268701],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0028021804,0.0010837709,0.0015312692,0.0029350636,0.0010534448,0.0020679317,0.004154458,0.0021507242,0.0094571095],"category_scores_gemma":[0.014455513,0.00078081974,0.0017758176,0.0022367097,0.0010913735,0.004477466,0.0058511784,0.0036972503,0.0032320174],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0003550678,0.000385514,0.0011661638,0.000431916,0.00014613257,0.00021501145,0.0002872201,0.07831257,0.0058614244,0.12237177,0.056133628,0.73433363],"study_design_scores_gemma":[0.000024502964,0.00004156484,0.00013564053,0.00003083565,0.000015858777,0.000062372594,0.000040697243,0.88224447,0.0020311968,0.10617034,0.009178226,0.000024262969],"about_ca_topic_score_codex":0.0074877464,"about_ca_topic_score_gemma":0.016486667,"teacher_disagreement_score":0.0094571095,"about_ca_system_score_codex":0.0010359155,"about_ca_system_score_gemma":0.0019655004,"threshold_uncertainty_score":0.03163719},"labels":[],"label_agreement":null},{"id":"W4401666276","doi":"10.1007/s10618-024-01054-7","title":"Bayesian network Motifs for reasoning over heterogeneous unlinked datasets","year":2024,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Canada Research Chairs; University of Toronto; University of New Brunswick","funders":"","keywords":"Computer science; Probabilistic logic; Bayesian network; Python (programming language); Data mining; Aggregate (composite); Real world data; Bayesian probability; Machine learning; Set (abstract data type); Artificial intelligence; Data science","score_opus":0.1674946705782729,"score_gpt":0.43586677779388994,"score_spread":0.26837210721561705,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4401666276","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.012657426,0.00058271654,0.98256564,0.00077794696,0.000046457833,0.00013195197,0.0010381691,0.001276814,0.0009229041],"genre_scores_gemma":[0.270836,0.000897358,0.7210087,0.00040826417,0.00014314237,0.00044691467,0.003841622,0.0002950105,0.0021228385],"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9952177,0.0016256484,0.00042655075,0.0010371234,0.0014628819,0.00023009206],"domain_scores_gemma":[0.96053725,0.03230933,0.0023915828,0.0023926334,0.001678909,0.0006903972],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0063038836,0.0009469164,0.0017246775,0.005379261,0.0013706028,0.0033775177,0.003754775,0.0031063743,0.005181895],"category_scores_gemma":[0.06944677,0.0012022932,0.0022096806,0.004837027,0.0015093818,0.010090972,0.0034635505,0.003721661,0.00094795635],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00063420215,0.00046322483,0.010364865,0.0010277127,0.0007022623,0.0010060051,0.0008345693,0.3029706,0.0032867668,0.3915555,0.00920718,0.27794722],"study_design_scores_gemma":[0.000036020225,0.000024290035,0.0003302174,0.00007642182,0.00007483584,0.00012933595,0.000062953106,0.60058373,0.000652386,0.3958277,0.002185132,0.000017020073],"about_ca_topic_score_codex":0.009635517,"about_ca_topic_score_gemma":0.014506013,"teacher_disagreement_score":0.009635517,"about_ca_system_score_codex":0.0021188527,"about_ca_system_score_gemma":0.0023747177,"threshold_uncertainty_score":0.033338487},"labels":[],"label_agreement":null},{"id":"W4408175168","doi":"10.1007/s10618-024-01084-1","title":"Efficient outlier detection in numerical and categorical data","year":2025,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"University of Alberta","funders":"Conselho Nacional de Desenvolvimento Científico e Tecnológico; Coordenação de Aperfeiçoamento de Pessoal de Nível Superior; Fundação de Amparo à Pesquisa do Estado de São Paulo; Carnegie Mellon University","keywords":"Categorical variable; Anomaly detection; Outlier; Computer science; Data mining; Artificial intelligence; Pattern recognition (psychology); Machine learning","score_opus":0.03590234063653296,"score_gpt":0.31659416447194305,"score_spread":0.2806918238354101,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4408175168","genre_codex":"methods","genre_gemma":"methods","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"methods","genre_consensus":"methods","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.10387523,0.0011519691,0.884253,0.0008388481,0.00023380178,0.00011958956,0.0015082234,0.006576526,0.0014428144],"genre_scores_gemma":[0.52508503,0.0003125083,0.46890625,0.00017940793,0.00013278791,0.00010183969,0.0036340193,0.00024083395,0.0014073387],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99654144,0.00071529334,0.00028868509,0.00081993535,0.0013789285,0.00025579642],"domain_scores_gemma":[0.99152946,0.0035052185,0.001140232,0.0012071388,0.0022561033,0.00036178489],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0023191045,0.00080100814,0.0017329976,0.0033146937,0.0005712726,0.001835923,0.0021824017,0.0010297985,0.0010250849],"category_scores_gemma":[0.012658064,0.00034610112,0.001033088,0.003601987,0.0007336323,0.0018165566,0.0017339694,0.0016396341,0.0009160505],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.00077882106,0.0004618866,0.05017883,0.0008298702,0.00048182343,0.00064704084,0.00037486674,0.18998596,0.032076243,0.014108315,0.024965689,0.68511075],"study_design_scores_gemma":[0.000022182034,0.00007385336,0.003295305,0.000029871542,0.000022390726,0.00026960004,0.00017578932,0.9690149,0.00919436,0.0143168485,0.0035559575,0.000028890985],"about_ca_topic_score_codex":0.0029843934,"about_ca_topic_score_gemma":0.0030513927,"teacher_disagreement_score":0.0033146937,"about_ca_system_score_codex":0.0007080211,"about_ca_system_score_gemma":0.0010908024,"threshold_uncertainty_score":0.012264729},"labels":[],"label_agreement":null},{"id":"W4414033870","doi":"10.1007/s10618-025-01158-8","title":"Detecting and reacting to smart home novelties","year":2025,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Data Stream Mining Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":false,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"Network for Business Sustainability","funders":"Defense Advanced Research Projects Agency; National Institutes of Health; National Science Foundation","keywords":"Computer science","score_opus":0.03636783725970738,"score_gpt":0.31255536409908324,"score_spread":0.27618752683937586,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4414033870","genre_codex":"empirical","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":"empirical","domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.90317136,0.0009449672,0.0804425,0.0026163575,0.0007185524,0.00023798455,0.0012469534,0.001683685,0.008937576],"genre_scores_gemma":[0.97869164,0.0002697557,0.018237887,0.00028714637,0.00015727749,0.00004104007,0.00053459255,0.00004608177,0.0017345711],"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.9984189,0.0002649691,0.00008595194,0.00037178863,0.0007182105,0.00014023062],"domain_scores_gemma":[0.9908338,0.0050109057,0.0017309096,0.00078236096,0.0011902688,0.00045181942],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0018272949,0.00046913594,0.0006719531,0.001521355,0.00042448525,0.0016193374,0.00096920517,0.0011624714,0.0013289454],"category_scores_gemma":[0.015002186,0.00021790336,0.0003986345,0.0009054086,0.00051556487,0.002341795,0.0012396885,0.0013830285,0.0004563744],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0030213445,0.001290423,0.38939494,0.0006889558,0.0007001551,0.008268006,0.003368596,0.034351684,0.057898317,0.017232282,0.024049431,0.4597358],"study_design_scores_gemma":[0.00011710153,0.0008138959,0.08749126,0.000116579264,0.00039659426,0.0033888728,0.0036920973,0.8188317,0.03437054,0.028633343,0.022037303,0.00011075367],"about_ca_topic_score_codex":0.0008277817,"about_ca_topic_score_gemma":0.0012979103,"teacher_disagreement_score":0.0018272949,"about_ca_system_score_codex":0.0004383357,"about_ca_system_score_gemma":0.0005154462,"threshold_uncertainty_score":0.00966382},"labels":[],"label_agreement":null},{"id":"W4417267046","doi":"10.1007/s10618-025-01180-w","title":"Certifying robustness of graph convolutional networks for node perturbation with polyhedra abstract interpretation","year":2025,"lang":"en","type":"article","venue":"Data Mining and Knowledge Discovery","topic":"Advanced Graph Neural Networks","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"route_ca_aff":true,"route_ca_fund":true,"route_ca_venue":false,"route_about_ca":false,"ca_institutions":"McGill University","funders":"Fonds de recherche du Québec – Nature et technologies; Nemzeti Kutatási Fejlesztési és Innovációs Hivatal; Mitacs; Knut och Alice Wallenbergs Stiftelse","keywords":"Robustness (evolution); Graph; Convolutional neural network; Adversarial system; Polyhedron; Training set","score_opus":0.031970765629140495,"score_gpt":0.29588145799663446,"score_spread":0.263910692367494,"validation_status":"score_only:v0-immature-baseline","prediction":{"id":"W4417267046","genre_codex":"methods","genre_gemma":"empirical","domain_codex":null,"domain_gemma":null,"model_version":"metacan-v3-hybrid-931329e0061c","genre_candidate":"empirical","genre_consensus":null,"domain_candidate":null,"domain_consensus":null,"prediction_status":"machine_predicted_unvalidated","genre_scores_codex":[0.08703447,0.0003745577,0.90380573,0.0013030019,0.00017771011,0.00008572472,0.0007600314,0.0023874238,0.004071386],"genre_scores_gemma":[0.92251664,0.0003207202,0.07161448,0.00046748918,0.00021654434,0.00012121856,0.0015736077,0.0005769086,0.0025924048],"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","domain_scores_codex":[0.99603623,0.0009125374,0.00022458608,0.0013185038,0.0011080079,0.00040020057],"domain_scores_gemma":[0.97530365,0.0153137455,0.0018317548,0.005014525,0.0019631581,0.000573186],"candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004447351,0.0015028664,0.0016829441,0.0020160712,0.0008619669,0.0028603137,0.0036179363,0.002804296,0.003980623],"category_scores_gemma":[0.045672234,0.0007803928,0.0019986702,0.0011311937,0.0041475375,0.0053836405,0.005294321,0.0044952887,0.0005867841],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_system_candidate":false,"about_ca_system_consensus":false,"study_design_scores_codex":[0.0006589548,0.00008332142,0.0033973847,0.00029923097,0.00025635524,0.00037511578,0.0001680826,0.7384124,0.007003783,0.1924198,0.0051121796,0.051813543],"study_design_scores_gemma":[0.000011492405,0.000027692377,0.00028842446,0.000018766106,0.000018260793,0.000037275895,0.000015703732,0.8305683,0.0022787997,0.16639976,0.0003245323,0.000011047775],"about_ca_topic_score_codex":0.0041252184,"about_ca_topic_score_gemma":0.0030242687,"teacher_disagreement_score":0.004447351,"about_ca_system_score_codex":0.0026717861,"about_ca_system_score_gemma":0.0017197995,"threshold_uncertainty_score":0.023520172},"labels":[],"label_agreement":null}]}