{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":529,"total_is_capped":false,"direct_labels_cover":1,"predictions_cover":529,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"7313441f4fd3","filters":{"topic":"Imbalanced Data Classification Techniques"}},"results":[{"id":"W2999309192","doi":"10.1186/s12864-019-6413-7","title":"The advantages of the Matthews correlation coefficient (MCC) over F1 score and accuracy in binary classification evaluation","year":2020,"lang":"en","type":"article","venue":"BMC Genomics","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":5819,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Ontario Tobacco Research Unit; Krembil Foundation","funders":"University of Toronto","keywords":"Binary classification; False positive paradox; Binary number; False positives and false negatives; Correlation; Confusion matrix; Artificial intelligence; Statistics; Pearson product-moment correlation coefficient; False positive rate; Confusion; Correlation coefficient; Matthews correlation coefficient; Computer science; Machine learning; Pattern recognition (psychology); Data mining; Mathematics; Support vector machine; Psychology; Arithmetic","authors":[{"name":"Davide Chicco","is_ca":true},{"name":"Giuseppe Jurman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06413411072449375,"gpt":0.3027767276479773,"spread":0.2386426169234835,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02849796,0.001570788,0.001730638,0.0132768,0.001649264,0.003726947,0.001233387,0.002016367,0.001411519],"category_scores_gemma":[0.1234165,0.0002962744,0.0009700214,0.008086227,0.002699645,0.002936627,0.001575349,0.001475063,0.0007575343],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002163354,"about_ca_system_score_gemma":0.001871885,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005362286,"about_ca_topic_score_gemma":0.005485408,"domain_scores_codex":[0.9655034,0.0136621,0.003428197,0.003981269,0.01238449,0.001040683],"domain_scores_gemma":[0.8101692,0.1292816,0.01820082,0.009798056,0.02989656,0.002653767],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002108999,0.0003611165,0.2894453,0.001849624,0.001746795,0.0007493255,0.001593378,0.06926706,0.01610241,0.03856149,0.04058396,0.5376304],"study_design_scores_gemma":[0.0001214639,0.002223496,0.2467224,0.0008546394,0.0007090099,0.00225738,0.001086595,0.613002,0.04941323,0.06159964,0.02128135,0.0007288244],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.5168672,0.01470315,0.4227583,0.00447984,0.001322152,0.0006038364,0.004069156,0.005361022,0.02983544],"genre_scores_gemma":[0.9229698,0.0006912611,0.07248671,0.0003321089,0.0004510386,0.0002446868,0.00111687,0.0003675778,0.001339898],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.02849796,"threshold_uncertainty_score":0.1507134,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1941659294","doi":"10.3233/ida-2002-6504","title":"The class imbalance problem: A systematic study1","year":2002,"lang":"en","type":"article","venue":"Intelligent Data Analysis","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":3298,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Class (philosophy); Psychology; Computer science; Artificial intelligence","authors":[{"name":"Nathalie Japkowicz","is_ca":true},{"name":"Shaju Stephen","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0727591430494873,"gpt":0.2990844827479253,"spread":0.226325339698438,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0435316,0.00181782,0.004126335,0.01452691,0.002486984,0.004220188,0.002437891,0.003046876,0.001316685],"category_scores_gemma":[0.1366493,0.001109844,0.001646496,0.01508942,0.003597342,0.008225242,0.003179472,0.00155469,0.0005243706],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001532807,"about_ca_system_score_gemma":0.005752864,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001333362,"about_ca_topic_score_gemma":0.003719326,"domain_scores_codex":[0.9398562,0.03054205,0.007092546,0.007079821,0.01495332,0.000475927],"domain_scores_gemma":[0.7057753,0.2277032,0.02383411,0.0108086,0.0308395,0.001039294],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005613827,0.0004369939,0.05826699,0.02459065,0.001123318,0.0004579317,0.002834832,0.001893429,0.002641465,0.01065535,0.01330841,0.8832292],"study_design_scores_gemma":[0.0009975593,0.006010386,0.1308598,0.08992421,0.01286231,0.01568694,0.02211422,0.02640592,0.03569788,0.1713067,0.4868121,0.001321869],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.08302546,0.5961828,0.3021837,0.006715476,0.001778301,0.001720653,0.00242397,0.0005389549,0.005430716],"genre_scores_gemma":[0.3978455,0.3633703,0.2190206,0.005006751,0.003028552,0.003885833,0.004914985,0.0004693569,0.002457951],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0435316,"threshold_uncertainty_score":0.2302199,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2096451472","doi":"10.1109/tkde.2005.50","title":"Using AUC and accuracy in evaluating learning algorithms","year":2005,"lang":"en","type":"article","venue":"IEEE Transactions on Knowledge and Data Engineering","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":2141,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Machine learning; Computer science; Artificial intelligence; Naive Bayes classifier; Decision tree; Measure (data warehouse); Receiver operating characteristic; Algorithm; Bayes' theorem; Data mining; Support vector machine; Bayesian probability","authors":[{"name":"Jin Huang","is_ca":true},{"name":"Charles X. Ling","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09066818198011457,"gpt":0.3642777199882067,"spread":0.2736095380080922,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05874668,0.002383707,0.003281337,0.02158175,0.001275367,0.009896017,0.002416904,0.005252562,0.001491223],"category_scores_gemma":[0.333273,0.0005635749,0.00174501,0.01611619,0.004263908,0.01232692,0.003655167,0.003964902,0.001279264],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002244469,"about_ca_system_score_gemma":0.00238119,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001989118,"about_ca_topic_score_gemma":0.001204542,"domain_scores_codex":[0.8771406,0.06951564,0.01190552,0.006517403,0.03319011,0.001730851],"domain_scores_gemma":[0.6652827,0.2669715,0.01955133,0.01746085,0.02794586,0.002787818],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001333094,0.0003707398,0.1185728,0.002068989,0.002124686,0.0004614014,0.001174812,0.1493007,0.00280197,0.1044201,0.01664843,0.6007223],"study_design_scores_gemma":[0.0002166663,0.002354494,0.05139852,0.001703061,0.0008737101,0.002268721,0.001131045,0.5649844,0.01107189,0.3191436,0.04424226,0.0006117574],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09970058,0.03269701,0.8313965,0.00467087,0.002160357,0.0005362559,0.00195229,0.00288674,0.02399947],"genre_scores_gemma":[0.6527705,0.006437828,0.331517,0.001423285,0.002100779,0.0007827391,0.002346695,0.0007698179,0.001851366],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.05874668,"threshold_uncertainty_score":0.3106859,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2015452969","doi":"10.1142/s0218001409007326","title":"CLASSIFICATION OF IMBALANCED DATA: A REVIEW","year":2009,"lang":"en","type":"review","venue":"International Journal of Pattern Recognition and Artificial Intelligence","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":1690,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo; Pattern Discovery Technologies (Canada)","funders":"","keywords":"Artificial intelligence; Computer science; Classifier (UML); Machine learning; One-class classification; Class (philosophy); Data classification","authors":[{"name":"Yanmin Sun","is_ca":true},{"name":"Andrew K. C. Wong","is_ca":true},{"name":"Mohamed S. Kamel","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3034801403945102,"gpt":0.4311119133602611,"spread":0.1276317729657509,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002664983,0.001121221,0.002872449,0.005268434,0.0004402152,0.001839468,0.002585465,0.001450439,0.002103588],"category_scores_gemma":[0.006035928,0.0005338745,0.0009873121,0.007572179,0.0009192607,0.003284726,0.0008395035,0.00150011,0.002412602],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007873302,"about_ca_system_score_gemma":0.001341196,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001349727,"about_ca_topic_score_gemma":0.001403006,"domain_scores_codex":[0.998542,0.0002302878,0.0002050434,0.0003073485,0.0006565796,0.0000587568],"domain_scores_gemma":[0.9961913,0.002016054,0.0004015512,0.0001178835,0.001179936,0.00009332912],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00005227902,0.00006788118,0.0006090546,0.008596545,0.00008912786,0.00008519146,0.00006400169,0.0007252007,0.000616149,0.002056977,0.01599456,0.9710429],"study_design_scores_gemma":[0.00004134734,0.0003188185,0.005508212,0.01541989,0.0004670621,0.003302191,0.000445305,0.003861357,0.00352519,0.01878535,0.9481884,0.000136889],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0005247368,0.9922199,0.004932545,0.0006229286,0.0004924937,0.00003020822,0.00006454329,0.00005166335,0.001061056],"genre_scores_gemma":[0.003359927,0.9890239,0.005705971,0.0003566499,0.000776612,0.00004199565,0.0001904369,0.00001195817,0.0005326758],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.005268434,"threshold_uncertainty_score":0.01409394,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2103614420","doi":"10.1016/j.patcog.2007.04.009","title":"Cost-sensitive boosting for classification of imbalanced data","year":2007,"lang":"en","type":"article","venue":"Pattern Recognition","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":1430,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Pattern Discovery Technologies (Canada); University of Waterloo","funders":"","keywords":"Boosting (machine learning); Tacking; AdaBoost; Machine learning; Artificial intelligence; Weighting; Computer science; Classifier (UML); Statistical classification; Data mining","authors":[{"name":"Yanmin Sun","is_ca":true},{"name":"Mohamed S. Kamel","is_ca":true},{"name":"Andrew K. C. Wong","is_ca":true},{"name":"Yang Wang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1947451742491384,"gpt":0.3649999840489949,"spread":0.1702548097998565,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00716187,0.001108802,0.002840796,0.001807132,0.0007691204,0.001350013,0.002113978,0.001302886,0.001385357],"category_scores_gemma":[0.01100349,0.0006443221,0.0008894226,0.001832624,0.0008015637,0.001899469,0.001718629,0.002044557,0.0006397381],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000814007,"about_ca_system_score_gemma":0.001023696,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001810722,"about_ca_topic_score_gemma":0.001688543,"domain_scores_codex":[0.9975418,0.000953533,0.0001493702,0.0003463624,0.0007880983,0.0002209027],"domain_scores_gemma":[0.9950054,0.002578126,0.0002838374,0.0009650081,0.0009784769,0.0001891847],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007650467,0.0004510375,0.004382341,0.0002742682,0.0002795444,0.0001379486,0.0001290982,0.2417109,0.01107326,0.011249,0.01341917,0.7161283],"study_design_scores_gemma":[0.00002258431,0.00005707571,0.0006569629,0.00001203437,0.00003350822,0.00005772967,0.00001047184,0.986388,0.002400075,0.009241818,0.001111896,0.000007979449],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04772428,0.002374866,0.9466415,0.0005310604,0.0002912442,0.0001083023,0.0001874373,0.0009796281,0.001161738],"genre_scores_gemma":[0.6781821,0.0009355114,0.3153096,0.0004274856,0.0005366956,0.0001915082,0.0008960436,0.0002171646,0.003303898],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00716187,"threshold_uncertainty_score":0.03787607,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2023639956","doi":"10.1111/j.0824-7935.2004.t01-1-00228.x","title":"A Multiple Resampling Method for Learning from Imbalanced Data Sets","year":2004,"lang":"en","type":"article","venue":"Computational Intelligence","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":1022,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Medical Protective Association; University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada; Dalhousie University","keywords":"Undersampling; Oversampling; Resampling; Computer science; Machine learning; Artificial intelligence; Class (philosophy); Scheme (mathematics); Task (project management); Data mining; Pattern recognition (psychology); Mathematics; Bandwidth (computing); Engineering","authors":[{"name":"Andrew Estabrooks","is_ca":true},{"name":"Taeho Jo","is_ca":true},{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1485671637564458,"gpt":0.3960542626513615,"spread":0.2474870988949157,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009075864,0.001351658,0.001727163,0.003678196,0.001139495,0.001300113,0.001874241,0.001285528,0.002285483],"category_scores_gemma":[0.01680551,0.0005350061,0.001978857,0.003216411,0.0009281844,0.001939879,0.00174509,0.002361783,0.001651604],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005520767,"about_ca_system_score_gemma":0.001019022,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001340776,"about_ca_topic_score_gemma":0.002488831,"domain_scores_codex":[0.994822,0.002018905,0.0003795325,0.0009162609,0.001701358,0.0001619315],"domain_scores_gemma":[0.995429,0.00174242,0.0003855372,0.001303368,0.001011883,0.0001277768],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003029794,0.0002610782,0.002092484,0.0002747707,0.0004372812,0.0001256558,0.0003006044,0.03378593,0.01508341,0.01123307,0.009048969,0.9270537],"study_design_scores_gemma":[0.0001626054,0.0005251495,0.00468505,0.0001010003,0.000290727,0.0007205858,0.0001722808,0.894112,0.03148017,0.03377352,0.03379772,0.000179129],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002921442,0.0001781012,0.9952233,0.00007426459,0.0001180863,0.0002370937,0.00009313384,0.0008511727,0.0003034291],"genre_scores_gemma":[0.03392754,0.0001807916,0.9633854,0.00008011689,0.000181308,0.0005992955,0.0004037748,0.0001473187,0.001094459],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.009075864,"threshold_uncertainty_score":0.04799831,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3126232929","doi":"10.1186/s13040-021-00244-z","title":"The Matthews correlation coefficient (MCC) is more reliable than balanced accuracy, bookmaker informedness, and markedness in two-class confusion matrix evaluation","year":2021,"lang":"en","type":"article","venue":"BioData Mining","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":893,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Krembil Foundation","funders":"Deutsche Forschungsgemeinschaft","keywords":"Confusion matrix; Correlation; False positive paradox; Computer science; Confusion; False positives and false negatives; Classifier (UML); Statistics; Artificial intelligence; Metric (unit); Correlation coefficient; Machine learning; Data mining; Mathematics; Psychology; Operations management","authors":[{"name":"Davide Chicco","is_ca":true},{"name":"Niklas Tötsch","is_ca":false},{"name":"Giuseppe Jurman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02927417731283126,"gpt":0.3307727570661502,"spread":0.3014985797533189,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01584418,0.001545204,0.001511071,0.007663949,0.001366348,0.003296727,0.001054969,0.00191533,0.001817628],"category_scores_gemma":[0.1107636,0.0003350041,0.0008541324,0.004399135,0.002304319,0.002821813,0.001821487,0.001428677,0.0009953736],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001400318,"about_ca_system_score_gemma":0.001319449,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003817915,"about_ca_topic_score_gemma":0.005058927,"domain_scores_codex":[0.9814667,0.005495087,0.002551811,0.003180954,0.0066273,0.0006782635],"domain_scores_gemma":[0.8398484,0.1025892,0.02223467,0.008470453,0.02368741,0.003169879],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0024924,0.0003610173,0.4226277,0.001822262,0.00262621,0.0009373054,0.002193426,0.1344294,0.0186979,0.02001596,0.04351469,0.3502817],"study_design_scores_gemma":[0.00009906881,0.001587682,0.1799962,0.0005762462,0.000605116,0.001548274,0.001153974,0.7163308,0.04192943,0.04094587,0.01463181,0.0005954534],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.6303577,0.007464869,0.3337457,0.00225208,0.0009788257,0.0005293683,0.003544639,0.004319874,0.01680693],"genre_scores_gemma":[0.9578433,0.0002957901,0.03816509,0.0002443196,0.0002563609,0.0001537767,0.001516277,0.0002316614,0.001293396],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01584418,"threshold_uncertainty_score":0.08379304,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2068258779","doi":"10.1109/acii.2013.47","title":"Facing Imbalanced Data--Recommendations for the Use of Performance Metrics","year":2013,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":806,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"National Institute of Mental Health; McMaster University; National Institutes of Health; University of Northern British Columbia","keywords":"Skew; Receiver operating characteristic; Computer science; Artificial intelligence; Machine learning; Precision and recall; Kappa; Pattern recognition (psychology); Statistics; Mathematics","authors":[{"name":"László A. Jeni","is_ca":false},{"name":"Jeffrey F. Cohn","is_ca":false},{"name":"Fernando De la Torre","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2246192492723406,"gpt":0.3280352919055073,"spread":0.1034160426331666,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1927615,0.003523107,0.006964528,0.01177033,0.00282944,0.01570882,0.008011551,0.005968012,0.002377681],"category_scores_gemma":[0.5096892,0.001782119,0.002288072,0.01044801,0.005323227,0.02682479,0.007585561,0.008188665,0.002947677],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005601122,"about_ca_system_score_gemma":0.006309843,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004742782,"about_ca_topic_score_gemma":0.003795794,"domain_scores_codex":[0.8832929,0.05431875,0.01614493,0.0123687,0.03193374,0.001940917],"domain_scores_gemma":[0.4797066,0.2720914,0.03772033,0.07417536,0.1273591,0.008947275],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0008604572,0.0007290344,0.07929391,0.001791669,0.0007286845,0.0002419894,0.002041185,0.02706338,0.004719854,0.04336506,0.07655354,0.7626113],"study_design_scores_gemma":[0.0006031445,0.001544691,0.03809402,0.005299142,0.0006636988,0.001281189,0.005029681,0.3558243,0.02148849,0.4616138,0.1076207,0.0009370893],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.03020939,0.01801861,0.8833676,0.04868975,0.002469717,0.001524939,0.002012909,0.00722289,0.006484203],"genre_scores_gemma":[0.1873922,0.005046889,0.7899827,0.005970465,0.002047464,0.002646924,0.002613941,0.002286945,0.002012413],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1927615,"threshold_uncertainty_score":0.9954689,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2011376672","doi":"10.1145/1007730.1007737","title":"Class imbalances versus small disjuncts","year":2004,"lang":"en","type":"article","venue":"ACM SIGKDD Explorations Newsletter","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":681,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Class (philosophy); Focus (optics); Classifier (UML); Artificial intelligence; Machine learning","authors":[{"name":"Taeho Jo","is_ca":true},{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.068174256664078,"gpt":0.279847161916715,"spread":0.211672905252637,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0092356,0.0008459234,0.001393928,0.001573763,0.001320537,0.003126877,0.001240193,0.00156577,0.003487227],"category_scores_gemma":[0.04035357,0.0003554256,0.0005308785,0.002080924,0.00247638,0.005249341,0.002541616,0.003003834,0.0009469661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000862524,"about_ca_system_score_gemma":0.0005854605,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003409783,"about_ca_topic_score_gemma":0.0005857431,"domain_scores_codex":[0.9904151,0.002924455,0.0007708457,0.002246215,0.003218947,0.000424373],"domain_scores_gemma":[0.9587988,0.0317678,0.00329871,0.003617362,0.001711249,0.00080604],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0030046,0.0007708713,0.03499009,0.0009170283,0.0002916762,0.0005246293,0.0009155563,0.04283617,0.03376814,0.04540804,0.01912977,0.8174434],"study_design_scores_gemma":[0.0004166562,0.002344748,0.03315799,0.0002793549,0.0002936823,0.002319312,0.001582813,0.5031462,0.07975813,0.3345167,0.04200795,0.0001764178],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.368705,0.00465528,0.5936243,0.007358557,0.0009433451,0.0007173375,0.001057946,0.001911701,0.02102649],"genre_scores_gemma":[0.8322751,0.0009214469,0.1607827,0.0008417431,0.0006566821,0.0002880942,0.000735569,0.0002150972,0.003283542],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0092356,"threshold_uncertainty_score":0.04884315,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2040010062","doi":"10.1145/1007730.1007736","title":"Learning from imbalanced data sets with boosting and data generation","year":2004,"lang":"en","type":"article","venue":"ACM SIGKDD Explorations Newsletter","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":606,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Boosting (machine learning); Machine learning; Computer science; Artificial intelligence; Benchmarking; Classifier (UML); Training set; Gradient boosting; Ensemble learning; Data mining; Random forest","authors":[{"name":"Hongyu Guo","is_ca":true},{"name":"Herna L. Viktor","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.145876779440151,"gpt":0.3158766600273255,"spread":0.1699998805871745,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01012599,0.001029702,0.002092245,0.002456422,0.000702399,0.001710349,0.002086115,0.001133151,0.0008363509],"category_scores_gemma":[0.0198863,0.0006702857,0.001443948,0.00230897,0.0008285598,0.002178635,0.002025449,0.002533391,0.0007567537],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007716983,"about_ca_system_score_gemma":0.0009543257,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000943973,"about_ca_topic_score_gemma":0.001077159,"domain_scores_codex":[0.9953701,0.001906347,0.00027151,0.0006042019,0.001617236,0.0002307024],"domain_scores_gemma":[0.9905869,0.004327372,0.0005689799,0.002237852,0.002063448,0.0002154235],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004069439,0.0003718267,0.008087236,0.0002144557,0.0002425807,0.000151637,0.000283609,0.3871716,0.007318225,0.01398506,0.008073177,0.5736937],"study_design_scores_gemma":[0.00003896306,0.00008663099,0.0007896099,0.00002477162,0.00002594687,0.00007759319,0.00003348284,0.9731848,0.005327262,0.01701707,0.003371358,0.00002251456],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02402752,0.0005182122,0.9717959,0.0003029614,0.0001826351,0.0002745624,0.0001621339,0.001482045,0.001253995],"genre_scores_gemma":[0.2527709,0.0004439974,0.7436776,0.0003648413,0.0002268879,0.0006070378,0.0008399132,0.0001824163,0.0008863565],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01012599,"threshold_uncertainty_score":0.05355203,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4205471456","doi":"10.1016/j.eswa.2021.116429","title":"Financial Fraud: A Review of Anomaly Detection Techniques and Recent Advances","year":2021,"lang":"en","type":"review","venue":"Expert Systems with Applications","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":544,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Alberta Oil Sands Technology and Research Authority; McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Credit card fraud; Anomaly detection; Exploit; Computer science; Insider; Artificial intelligence; Business; Finance; Computer security; Credit card; Payment","authors":[{"name":"Waleed Hilal","is_ca":true},{"name":"S. Andrew Gadsden","is_ca":true},{"name":"John Yawney","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02676344441469306,"gpt":0.3305285859300074,"spread":0.3037651415153144,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001734217,0.001180651,0.001527705,0.006407836,0.0005020114,0.001863977,0.001713806,0.001549584,0.00323342],"category_scores_gemma":[0.00450435,0.0005300572,0.001022899,0.007395253,0.0008427688,0.003180168,0.0008439163,0.001760766,0.001972456],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008831574,"about_ca_system_score_gemma":0.001955863,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001914189,"about_ca_topic_score_gemma":0.002048791,"domain_scores_codex":[0.9990112,0.0001522796,0.0001503191,0.0001600224,0.000466805,0.00005936763],"domain_scores_gemma":[0.9958888,0.002634282,0.0003185525,0.0001036906,0.000940109,0.0001146103],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004400338,0.00008802259,0.0006675661,0.01282529,0.00009453592,0.0001285915,0.0001050043,0.0007506951,0.0005004781,0.005551786,0.02496596,0.9542781],"study_design_scores_gemma":[0.00001537741,0.0001635133,0.002697349,0.01223484,0.0002840962,0.001791277,0.0002235558,0.001225789,0.0008157347,0.008585515,0.9718844,0.00007847069],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0002945432,0.9956808,0.001410399,0.0006420445,0.0003030525,0.00001385818,0.00003978912,0.00003027485,0.001585161],"genre_scores_gemma":[0.001550433,0.9960038,0.001301924,0.0002402802,0.0004169469,0.00001149392,0.00006799899,0.000006019848,0.0004011118],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.006407836,"threshold_uncertainty_score":0.01081693,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4321214126","doi":"10.1186/s13040-023-00322-4","title":"The Matthews correlation coefficient (MCC) should replace the ROC AUC as the standard metric for assessing binary classification","year":2023,"lang":"en","type":"article","venue":"BioData Mining","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":513,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Receiver operating characteristic; Matthews correlation coefficient; Binary classification; Statistics; Confusion matrix; False positive rate; Artificial intelligence; Correlation; Mathematics; Binary number; Sensitivity (control systems); Metric (unit); Classifier (UML); Computer science; Pattern recognition (psychology); Machine learning; Support vector machine; Arithmetic","authors":[{"name":"Davide Chicco","is_ca":true},{"name":"Giuseppe Jurman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1099873591318314,"gpt":0.3627967148767833,"spread":0.2528093557449519,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01530556,0.002756914,0.004081455,0.003941244,0.0009771422,0.004764434,0.003884683,0.005842996,0.006873861],"category_scores_gemma":[0.09827743,0.0008002041,0.001730083,0.006211227,0.003612601,0.004704223,0.001725498,0.005976944,0.01251109],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002863693,"about_ca_system_score_gemma":0.003009216,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003513164,"about_ca_topic_score_gemma":0.003343298,"domain_scores_codex":[0.981873,0.005489669,0.002355809,0.002591823,0.007197795,0.0004919061],"domain_scores_gemma":[0.9382277,0.0345214,0.007168982,0.005280702,0.01335584,0.001445459],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0005443954,0.0001262674,0.01733394,0.003481501,0.0008541755,0.0007132969,0.0002993405,0.004302681,0.004502175,0.05068823,0.5676448,0.3495092],"study_design_scores_gemma":[0.0002152485,0.001137028,0.04118559,0.003305807,0.0009035009,0.00621452,0.0005875552,0.04324102,0.02648873,0.1804464,0.6952102,0.001064406],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02861718,0.1832888,0.5222214,0.1014407,0.07616145,0.00126635,0.01073733,0.01671157,0.05955528],"genre_scores_gemma":[0.3390985,0.06127909,0.4569612,0.05931128,0.02679771,0.003372934,0.01172351,0.005896053,0.03555974],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9846944,"threshold_uncertainty_score":0.08094454,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1514907448","doi":"","title":"AUC: a statistically consistent and more discriminating measure than accuracy","year":2003,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":502,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of New Brunswick; Western University","funders":"","keywords":"Measure (data warehouse); Receiver operating characteristic; Computer science; Consistency (knowledge bases); Machine learning; Artificial intelligence; Data mining","authors":[{"name":"Charles X. Ling","is_ca":true},{"name":"Jin Huang","is_ca":true},{"name":"Harry Zhang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03047426631467451,"gpt":0.2873676294616058,"spread":0.2568933631469313,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03800844,0.00218982,0.00376803,0.0123182,0.00112841,0.008814758,0.00211356,0.004178661,0.001567309],"category_scores_gemma":[0.1757467,0.0004912505,0.001494648,0.01163972,0.00524669,0.009527425,0.002851559,0.004509401,0.001316256],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001496335,"about_ca_system_score_gemma":0.002290206,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008264958,"about_ca_topic_score_gemma":0.0005421338,"domain_scores_codex":[0.9385584,0.02565693,0.007156195,0.008275724,0.01933756,0.001015272],"domain_scores_gemma":[0.7403361,0.1860999,0.02755865,0.02433261,0.01951098,0.002161752],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001323435,0.0005914142,0.1854758,0.002538638,0.003171866,0.0006011437,0.001260558,0.07143935,0.01528093,0.1352763,0.02872174,0.5543188],"study_design_scores_gemma":[0.0003305018,0.004372919,0.1328152,0.001432352,0.001661656,0.0047378,0.00123288,0.2722884,0.03693908,0.4620415,0.08109685,0.001050795],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.08800534,0.01054241,0.8764524,0.004552491,0.001426644,0.0003450663,0.003586704,0.00278478,0.01230417],"genre_scores_gemma":[0.7008691,0.003110541,0.2828441,0.002554877,0.002007895,0.0007738512,0.004440551,0.001316592,0.00208255],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.03800844,"threshold_uncertainty_score":0.2010102,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W129457532","doi":"","title":"Learning from Imbalanced Data Sets: A Comparison of Various Strategies *","year":2000,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":453,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Dalhousie University","funders":"","keywords":"Class (philosophy); Connectionism; Computer science; Artificial intelligence; Machine learning; Training set; Artificial neural network","authors":[{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05633284169889121,"gpt":0.3302678964709482,"spread":0.273935054772057,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02400543,0.001879342,0.002703425,0.006533719,0.00127085,0.00439275,0.004088454,0.002143413,0.001714628],"category_scores_gemma":[0.03577718,0.0005795167,0.001323531,0.005133166,0.001832078,0.008547195,0.005196169,0.002123755,0.001148078],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001718826,"about_ca_system_score_gemma":0.002083384,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002251965,"about_ca_topic_score_gemma":0.002662116,"domain_scores_codex":[0.9896526,0.004268782,0.0008040551,0.001120397,0.003773235,0.0003810179],"domain_scores_gemma":[0.9744574,0.01779977,0.001066551,0.003052195,0.003003283,0.0006207519],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001058312,0.0003904634,0.005705711,0.0006843513,0.0004381858,0.00006373014,0.0006650905,0.02783629,0.001107486,0.01531604,0.007371752,0.9393626],"study_design_scores_gemma":[0.000475488,0.001260072,0.00869442,0.0005229979,0.0005201768,0.0005056207,0.002230142,0.8608602,0.009302827,0.09357041,0.02189836,0.0001593054],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1060803,0.02321627,0.8491836,0.003394062,0.0005942018,0.001392454,0.0008075674,0.003310448,0.01202107],"genre_scores_gemma":[0.4724387,0.009083277,0.5104118,0.0008604011,0.0004942407,0.000944025,0.00188323,0.0005303164,0.003353986],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02400543,"threshold_uncertainty_score":0.1269544,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4316469706","doi":"10.3390/info14010054","title":"A Comparison of Undersampling, Oversampling, and SMOTE Methods for Dealing with Imbalanced Classification in Educational Data Mining","year":2023,"lang":"en","type":"article","venue":"Information","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":340,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Undersampling; Oversampling; Resampling; Random forest; Computer science; Machine learning; Class (philosophy); Data mining; Sampling (signal processing); Artificial intelligence; Bandwidth (computing)","authors":[{"name":"Tarid Wongvorachan","is_ca":true},{"name":"Surina He","is_ca":true},{"name":"Okan Bulut","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1915929103132564,"gpt":0.4664089199150849,"spread":0.2748160096018285,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01416285,0.001047933,0.001459435,0.002574177,0.0009016976,0.0009602769,0.001322771,0.001087868,0.0004298837],"category_scores_gemma":[0.0271285,0.0003856423,0.001408612,0.001761205,0.0007959108,0.002060934,0.001391945,0.001573451,0.0001719491],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00071674,"about_ca_system_score_gemma":0.001730406,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005630831,"about_ca_topic_score_gemma":0.007916315,"domain_scores_codex":[0.9936543,0.003645141,0.0004066482,0.0005727663,0.00146936,0.0002517663],"domain_scores_gemma":[0.9855759,0.00946067,0.000826259,0.001432977,0.002404564,0.0002995941],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001650491,0.0005713325,0.02512867,0.0005369937,0.0008484118,0.0001170066,0.0007477621,0.2507116,0.006171947,0.01029661,0.004046755,0.6991723],"study_design_scores_gemma":[0.00006209952,0.0003193576,0.004182845,0.00005856554,0.00008130027,0.00008264864,0.0001492332,0.9869021,0.002897478,0.003499737,0.001736496,0.00002801475],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1171351,0.004400431,0.8744875,0.0006418643,0.0003194069,0.0004015696,0.0001989723,0.001042152,0.001373016],"genre_scores_gemma":[0.4325219,0.001740768,0.5631222,0.0003323987,0.0002867591,0.0003941434,0.0007787157,0.0001116781,0.0007114488],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01416285,"threshold_uncertainty_score":0.07490122,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2115650093","doi":"10.1007/s10994-006-8199-5","title":"Cost curves: An improved method for visualizing classifier performance","year":2006,"lang":"en","type":"article","venue":"Machine Learning","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":324,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta; National Research Council Canada","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Classifier (UML); Computer science; Artificial intelligence; Pattern recognition (psychology); Software; Learning curve; Visualization; Machine learning; Receiver operating characteristic; Range (aeronautics); Data mining; Engineering","authors":[{"name":"Chris Drummond","is_ca":true},{"name":"Robert C. Holte","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03939313177323189,"gpt":0.3477566611305509,"spread":0.308363529357319,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0051099,0.003048804,0.001932663,0.01166642,0.0008696507,0.003718589,0.002561275,0.002528735,0.01102533],"category_scores_gemma":[0.03230528,0.000757734,0.001354832,0.008843739,0.0006708992,0.005042055,0.001804519,0.003277107,0.00350804],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00124497,"about_ca_system_score_gemma":0.001418352,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008913709,"about_ca_topic_score_gemma":0.006105118,"domain_scores_codex":[0.9964486,0.0007101151,0.0003461571,0.0004432131,0.001807753,0.0002440851],"domain_scores_gemma":[0.9784857,0.01130229,0.001623638,0.002422804,0.005674544,0.0004909429],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001012863,0.0003506039,0.008695398,0.0008251722,0.0004402438,0.0001792478,0.0006304036,0.07848797,0.01832888,0.0154131,0.06606402,0.8095722],"study_design_scores_gemma":[0.0001077125,0.0002190442,0.007688445,0.0001180628,0.0001424947,0.000365523,0.0001384152,0.9269266,0.01994453,0.02110229,0.02296705,0.0002798008],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01716969,0.0007280799,0.9532284,0.000333103,0.000262602,0.0001838314,0.003478459,0.02157284,0.003042994],"genre_scores_gemma":[0.1926935,0.0006936335,0.7890846,0.0002290484,0.0002383063,0.0007763379,0.004371529,0.006533224,0.005379832],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01166642,"threshold_uncertainty_score":0.03688341,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W752888290","doi":"10.1007/s10844-015-0368-1","title":"Types of minority class examples and their influence on learning classifiers from imbalanced data","year":2015,"lang":"en","type":"article","venue":"Journal of Intelligent Information Systems","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":287,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"University of Ottawa","keywords":"Computer science; Outlier; Machine learning; Artificial intelligence; Identification (biology); Class (philosophy); Classifier (UML); Neighbourhood (mathematics); Data mining; Data type; Mathematics","authors":[{"name":"Krystyna Napierała","is_ca":false},{"name":"Jerzy Stefanowski","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07618345526224594,"gpt":0.2870352410138041,"spread":0.2108517857515581,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01447692,0.0008253405,0.00106036,0.002456373,0.001011576,0.00258091,0.000873751,0.001124423,0.0005305763],"category_scores_gemma":[0.07782118,0.0003881007,0.0006653268,0.001303614,0.001891854,0.003527752,0.001675586,0.001393664,0.0002380791],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007369442,"about_ca_system_score_gemma":0.000432668,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008182069,"about_ca_topic_score_gemma":0.0008984889,"domain_scores_codex":[0.9898114,0.004118625,0.000768271,0.001571038,0.003348244,0.0003824949],"domain_scores_gemma":[0.882947,0.09750053,0.006125462,0.006334731,0.006018253,0.001073913],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003427533,0.0005729983,0.2269756,0.001109336,0.0004647976,0.001285757,0.004555419,0.1915412,0.03758106,0.009722107,0.003360027,0.5194042],"study_design_scores_gemma":[0.0000633952,0.000859607,0.1044574,0.0003031906,0.0003190578,0.001942618,0.003068864,0.7985876,0.06197484,0.02283254,0.005373615,0.0002172188],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.8546156,0.001783219,0.1397681,0.000571628,0.000130509,0.0001461919,0.0001972341,0.000318057,0.002469531],"genre_scores_gemma":[0.9580126,0.0003137265,0.04093641,0.00005524167,0.00005938441,0.00006170933,0.0002262549,0.00007597881,0.0002587917],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01447692,"threshold_uncertainty_score":0.07656223,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2126734246","doi":"10.1007/s10115-009-0198-y","title":"Boosting support vector machines for imbalanced data sets","year":2009,"lang":"en","type":"article","venue":"Knowledge and Information Systems","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":279,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"National Institutes of Health","keywords":"Support vector machine; Boosting (machine learning); Classifier (UML); Machine learning; Artificial intelligence; Computer science; Margin classifier; Data mining; Structured support vector machine; Relevance vector machine; Pattern recognition (psychology)","authors":[{"name":"Benjamin Wang","is_ca":false},{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03635550629993588,"gpt":0.3092264469905259,"spread":0.27287094069059,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008011001,0.0009689268,0.002682338,0.002403769,0.0007545329,0.001490138,0.001701568,0.001207216,0.00100659],"category_scores_gemma":[0.02421632,0.0006982004,0.0008906369,0.002278053,0.0007072627,0.002535664,0.001753574,0.002273642,0.0006797113],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000646519,"about_ca_system_score_gemma":0.0008980531,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00152806,"about_ca_topic_score_gemma":0.001288506,"domain_scores_codex":[0.996557,0.001210911,0.0002647609,0.0004861411,0.001259009,0.0002221163],"domain_scores_gemma":[0.9889899,0.006535327,0.0006749143,0.001445471,0.002089565,0.0002646903],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005129984,0.0003408183,0.004731841,0.000348443,0.0002255754,0.0001331977,0.0001660846,0.2980393,0.004411284,0.0138503,0.009289028,0.6679512],"study_design_scores_gemma":[0.00001363062,0.00003460746,0.0004371813,0.000011616,0.00002235099,0.00002701982,0.00001385033,0.9864187,0.0009436852,0.01130033,0.0007718347,0.000005257896],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03903639,0.002098255,0.9563919,0.000492308,0.0002368158,0.0000759656,0.0001500282,0.0007503307,0.0007679068],"genre_scores_gemma":[0.6567967,0.001560552,0.3365908,0.0002157345,0.0007992375,0.000216737,0.001187565,0.000146811,0.002485865],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008011001,"threshold_uncertainty_score":0.04236674,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4313421210","doi":"10.1007/s10994-022-06268-8","title":"The class imbalance problem in deep learning","year":2022,"lang":"en","type":"article","venue":"Machine Learning","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":270,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa; National Research Council Canada; University of Alberta","funders":"","keywords":"Artificial intelligence; Deep learning; Computer science; Machine learning; Class (philosophy); Context (archaeology)","authors":[{"name":"Kushankur Ghosh","is_ca":true},{"name":"Colin Bellinger","is_ca":true},{"name":"Roberto Corizzo","is_ca":false},{"name":"Paula Branco","is_ca":true},{"name":"Bartosz Krawczyk","is_ca":false},{"name":"Nathalie Japkowicz","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.007893058798280584,"gpt":0.2351205030355744,"spread":0.2272274442372938,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01449408,0.0009669418,0.002227949,0.001564289,0.00149222,0.003510124,0.00257859,0.00284794,0.001777309],"category_scores_gemma":[0.04942196,0.001052977,0.0009166725,0.002789885,0.003069341,0.008102885,0.003722457,0.007128584,0.0004575509],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002133526,"about_ca_system_score_gemma":0.00204153,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002037261,"about_ca_topic_score_gemma":0.002117167,"domain_scores_codex":[0.991567,0.003327344,0.0004755483,0.001490694,0.002700034,0.0004394547],"domain_scores_gemma":[0.9776968,0.01551331,0.001723481,0.002497587,0.00216492,0.0004039591],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0005641942,0.0003346279,0.01250762,0.0006879725,0.0002931908,0.0003736926,0.000603973,0.1315224,0.002620684,0.2685615,0.03197213,0.5499581],"study_design_scores_gemma":[0.00003842068,0.00006743457,0.001607836,0.0001078531,0.00004604247,0.0002016005,0.0001108795,0.5631695,0.00264576,0.4250232,0.006953498,0.00002799139],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"review","genre_scores_codex":[0.02149487,0.003525169,0.9677591,0.004074173,0.0005334838,0.00006431165,0.0002595072,0.0003401246,0.001949238],"genre_scores_gemma":[0.6581174,0.004847474,0.3212494,0.002541717,0.002495955,0.0005685629,0.001091097,0.0003698313,0.008718563],"genre_candidate":"review","genre_consensus":null,"teacher_disagreement_score":0.01449408,"threshold_uncertainty_score":0.07665294,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4378417908","doi":"10.1016/j.asoc.2023.110415","title":"A broad review on class imbalance learning techniques","year":2023,"lang":"en","type":"review","venue":"Applied Soft Computing","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":258,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Computer science; Machine learning; Artificial intelligence; Class (philosophy); Support vector machine; Data science","authors":[{"name":"Salim Rezvani","is_ca":true},{"name":"Xizhao Wang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05958989506665886,"gpt":0.3534783318788895,"spread":0.2938884368122306,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001576785,0.001148921,0.00175562,0.00449439,0.0004226353,0.001894739,0.00137007,0.001332092,0.005320895],"category_scores_gemma":[0.004781172,0.0004991899,0.0008735246,0.007541057,0.000681387,0.002772037,0.001046637,0.001981104,0.003168285],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007795054,"about_ca_system_score_gemma":0.002125563,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001785096,"about_ca_topic_score_gemma":0.002440008,"domain_scores_codex":[0.9991505,0.0001447541,0.000100181,0.0001816132,0.0003790512,0.00004393271],"domain_scores_gemma":[0.9975765,0.001483989,0.0001537652,0.0000833837,0.000631342,0.00007102415],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0000378118,0.00006290729,0.000242645,0.007359165,0.00007268563,0.00003710479,0.00003260663,0.0007461192,0.0005725211,0.005413518,0.03411775,0.9513053],"study_design_scores_gemma":[0.00002724934,0.0001480509,0.00163797,0.009256451,0.0003085707,0.0006912761,0.00009628134,0.003034102,0.001515667,0.01993138,0.9632801,0.00007302943],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0003255164,0.9865079,0.007741988,0.001066284,0.0008561953,0.00002556929,0.000097098,0.00006950063,0.003310012],"genre_scores_gemma":[0.002385982,0.9861642,0.007047292,0.0008781665,0.00148239,0.00003639927,0.0002190134,0.00003060044,0.001756041],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.005320895,"threshold_uncertainty_score":0.01780021,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2012290523","doi":"10.1016/j.eswa.2011.09.058","title":"Gradient boosting trees for auto insurance loss cost modeling and prediction","year":2011,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":251,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Royal Bank of Canada","funders":"","keywords":"Computer science; Gradient boosting; Softmax function; Support vector machine; Feature selection; Data mining; Parameterized complexity; Generalized linear model; Hinge loss; Artificial neural network; Data pre-processing; Machine learning; Artificial intelligence; Algorithm; Mathematical optimization; Random forest; Mathematics","authors":[{"name":"Leo Guelman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04805340199553818,"gpt":0.2653546485366028,"spread":0.2173012465410646,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003945287,0.0006988691,0.001916794,0.001095439,0.0004706851,0.0009674121,0.001690314,0.001477408,0.001728938],"category_scores_gemma":[0.007469957,0.0007188075,0.0008285326,0.001206655,0.0004236295,0.001518502,0.0006556535,0.001922548,0.0007175068],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007760111,"about_ca_system_score_gemma":0.0009020456,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004047426,"about_ca_topic_score_gemma":0.004151616,"domain_scores_codex":[0.9991721,0.0003718915,0.00004902322,0.000129637,0.0001981928,0.00007917862],"domain_scores_gemma":[0.9972772,0.001864399,0.0001430592,0.0002252772,0.0004091862,0.00008087009],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001070762,0.0001141603,0.001404484,0.00005536719,0.00006347003,0.0000440677,0.00003639313,0.8271843,0.0007528865,0.01206032,0.004449253,0.1537284],"study_design_scores_gemma":[0.000001624004,0.00000418365,0.0000644207,0.000002012904,0.000003162475,0.000003720029,9.69007e-7,0.9965428,0.00007814548,0.003147951,0.0001496426,0.000001444359],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01726013,0.0008897771,0.9803104,0.0002324196,0.00006891465,0.00002933138,0.0001218998,0.0004975559,0.0005896931],"genre_scores_gemma":[0.6859136,0.001097189,0.305214,0.0002141195,0.0002979552,0.0002078765,0.0007745901,0.0002204207,0.006060367],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004047426,"threshold_uncertainty_score":0.02086496,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2137539029","doi":"10.1109/icdm.2003.1250975","title":"Comparing naive Bayes, decision trees, and SVM with AUC and accuracy","year":2004,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":235,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Support vector machine; Naive Bayes classifier; Computer science; Machine learning; Decision tree; Artificial intelligence; Receiver operating characteristic; Measure (data warehouse); Data mining; Bayes' theorem; Statistical classification; Bayesian probability","authors":[{"name":"Jin Huang","is_ca":true},{"name":"Jun Lü","is_ca":true},{"name":"Charles X. Ling","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0216262061828978,"gpt":0.2627378892251433,"spread":0.2411116830422455,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02779881,0.001268851,0.002146527,0.00638643,0.0007769028,0.003050128,0.001450649,0.001868253,0.001669645],"category_scores_gemma":[0.1587081,0.0003647519,0.001198825,0.007314381,0.001364393,0.007487219,0.001482805,0.001425599,0.000682661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001702633,"about_ca_system_score_gemma":0.001480041,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004527596,"about_ca_topic_score_gemma":0.003709503,"domain_scores_codex":[0.9728076,0.01636763,0.001711286,0.001874388,0.006635853,0.0006030768],"domain_scores_gemma":[0.8656941,0.1107785,0.004324812,0.006527451,0.0113021,0.001372952],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003718941,0.0004772055,0.07007833,0.001417469,0.001547667,0.0002042978,0.0004649487,0.2184313,0.001289899,0.04137048,0.01897375,0.6420257],"study_design_scores_gemma":[0.0002251327,0.001251427,0.02339903,0.0002445354,0.0003564466,0.0004112769,0.0003945273,0.8541604,0.002087813,0.1101091,0.007192376,0.0001679691],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3474491,0.02890098,0.5914775,0.004975573,0.002479131,0.0004925319,0.002387932,0.002167019,0.01967026],"genre_scores_gemma":[0.8071651,0.003644203,0.1827303,0.0005212813,0.001109951,0.0002746788,0.002473261,0.0002863109,0.001794905],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02779881,"threshold_uncertainty_score":0.1470159,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2147834490","doi":"","title":"Exploiting the Cost (In)sensitivity of Decision Tree Splitting Criteria","year":2000,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":202,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Pruning; Decision tree; Sensitivity (control systems); Computer science; Tree (set theory); Class (philosophy); Incremental decision tree; Total cost; Mathematical optimization; Decision tree learning; ID3 algorithm; Artificial intelligence; Machine learning; Mathematics; Statistics; Engineering; Combinatorics","authors":[{"name":"Chris Drummond","is_ca":true},{"name":"Robert C. Holte","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03196853507049728,"gpt":0.3018882251731047,"spread":0.2699196901026074,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01143979,0.00135946,0.001302052,0.002120753,0.0006282658,0.002580429,0.001225088,0.00131387,0.001350708],"category_scores_gemma":[0.07770069,0.0006675438,0.0005467318,0.001196773,0.001181277,0.003335068,0.001677313,0.001906977,0.0003725153],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001251981,"about_ca_system_score_gemma":0.0007169354,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001179914,"about_ca_topic_score_gemma":0.001123134,"domain_scores_codex":[0.9910114,0.004351676,0.0005489179,0.0006631122,0.003079648,0.0003453092],"domain_scores_gemma":[0.9182705,0.06581729,0.004871872,0.004276495,0.006079743,0.0006839852],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005115074,0.0002752556,0.02515869,0.0003957839,0.0003073532,0.0004436697,0.0006225071,0.5991142,0.0408245,0.02069996,0.001589741,0.3100569],"study_design_scores_gemma":[0.00002319912,0.0002395706,0.004730488,0.00006201281,0.0001118843,0.000370093,0.00008026776,0.9516231,0.01794782,0.02337416,0.00138145,0.00005602118],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2040488,0.001124785,0.7885079,0.000604371,0.0001103403,0.0001966507,0.00008810763,0.0004246622,0.00489439],"genre_scores_gemma":[0.8200427,0.0003970115,0.1778382,0.0002106257,0.000123622,0.00009303969,0.0001375709,0.0001935483,0.000963665],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01143979,"threshold_uncertainty_score":0.06050009,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4382196087","doi":"10.1016/j.neuroimage.2023.120253","title":"Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data","year":2023,"lang":"en","type":"article","venue":"NeuroImage","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":196,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University; Mila - Quebec Artificial Intelligence Institute; Montreal Neurological Institute and Hospital; Concordia University; University of Alberta; Université de Montréal","funders":"Fonds de recherche du Québec – Nature et technologies; Courtois Foundation; Natural Sciences and Engineering Research Council of Canada; Institut de Valorisation des Données; Canada Research Chairs; Canada First Research Excellence Fund; Canadian Institutes of Health Research; Mitacs; McGill University","keywords":"Magnetoencephalography; Computer science; Robustness (evolution); Metric (unit); Artificial intelligence; Binary classification; Decoding methods; Machine learning; Class (philosophy); Random forest; Performance metric; Receiver operating characteristic; Electroencephalography; Brain activity and meditation; Binary number; Sensitivity (control systems); Pattern recognition (psychology); Support vector machine; Mathematics; Psychology; Algorithm","authors":[{"name":"Philipp Thölke","is_ca":true},{"name":"Yorguin-José Mantilla-Ramos","is_ca":true},{"name":"Hamza Abdelhedi","is_ca":true},{"name":"Charlotte Maschke","is_ca":true},{"name":"Arthur Dehgan","is_ca":true},{"name":"Yann Harel","is_ca":true},{"name":"Anirudha Kemtur","is_ca":true},{"name":"Loubna Mekki Berrada","is_ca":true},{"name":"Myriam Sahraoui","is_ca":true},{"name":"Tammy Young","is_ca":true},{"name":"Antoine Bellemare","is_ca":true},{"name":"Clara El Khantour","is_ca":true},{"name":"Mathieu Landry","is_ca":true},{"name":"Annalisa Pascarella","is_ca":false},{"name":"Vanessa Hadid","is_ca":true},{"name":"Etienne Combrisson","is_ca":false},{"name":"Jordan O’Byrne","is_ca":true},{"name":"Karim Jerbi","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08644324549238729,"gpt":0.317593803694679,"spread":0.2311505582022917,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01991516,0.001986678,0.001591901,0.003263088,0.0009860853,0.004109141,0.001236202,0.002280575,0.000902408],"category_scores_gemma":[0.09566531,0.0003940693,0.0006153399,0.002019551,0.00233761,0.005461458,0.002993139,0.003331244,0.0007766685],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001477687,"about_ca_system_score_gemma":0.001575874,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001629996,"about_ca_topic_score_gemma":0.001302123,"domain_scores_codex":[0.9904774,0.004835455,0.0006915889,0.001619878,0.001953651,0.0004219576],"domain_scores_gemma":[0.9703039,0.01919219,0.003274312,0.003214452,0.003288832,0.0007262864],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002309312,0.0004995588,0.07749198,0.0008575487,0.0006203907,0.0005865954,0.001814442,0.2153459,0.03034176,0.03874887,0.02109061,0.610293],"study_design_scores_gemma":[0.00009229598,0.0005791127,0.01680256,0.0004163591,0.0001180785,0.0004864786,0.0008539077,0.8112596,0.02733096,0.1349304,0.00692737,0.0002028536],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1924476,0.004298441,0.7906126,0.005118312,0.0005900176,0.000347207,0.0009174489,0.001826452,0.003842023],"genre_scores_gemma":[0.802477,0.001145293,0.1923221,0.0009809299,0.0003206066,0.0003637999,0.001099163,0.0005587228,0.0007323668],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01991516,"threshold_uncertainty_score":0.1053227,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4321380810","doi":"10.1109/tim.2023.3246470","title":"A Systematic Review on Imbalanced Learning Methods in Intelligent Fault Diagnosis","year":2023,"lang":"en","type":"review","venue":"IEEE Transactions on Instrumentation and Measurement","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":191,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia, Okanagan Campus; University of British Columbia","funders":"National Key Research and Development Program of China","keywords":"Fault (geology); Computer science; Process (computing); Field (mathematics); Set (abstract data type); Artificial intelligence; Machine learning; Data processing; Data mining; Engineering","authors":[{"name":"Zhijun Ren","is_ca":false},{"name":"Tantao Lin","is_ca":false},{"name":"Ke Feng","is_ca":true},{"name":"Yongsheng Zhu","is_ca":false},{"name":"Zheng Liu","is_ca":true},{"name":"Ke Yan","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1601030557112119,"gpt":0.4134479746721709,"spread":0.253344918960959,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004632354,0.001460175,0.002695025,0.006368442,0.0005238678,0.002038673,0.001805002,0.001754822,0.004843956],"category_scores_gemma":[0.01851109,0.0007004133,0.002579158,0.006565938,0.0006939175,0.002857531,0.0009487067,0.001170194,0.001070946],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001236085,"about_ca_system_score_gemma":0.00589444,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003651886,"about_ca_topic_score_gemma":0.005578811,"domain_scores_codex":[0.9974457,0.0006959405,0.0006792277,0.0003427392,0.0007594518,0.0000769792],"domain_scores_gemma":[0.9876369,0.009391698,0.0008974086,0.0002988991,0.001634401,0.0001407111],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"systematic_review","study_design_scores_codex":[0.0001454063,0.00007312234,0.001287298,0.1581843,0.0008847943,0.0002059463,0.0002111185,0.003519132,0.0005670466,0.00578302,0.02627109,0.8028677],"study_design_scores_gemma":[0.0001363735,0.0005707833,0.006898695,0.2215684,0.006175931,0.001812972,0.0005379122,0.008034806,0.001395026,0.01875602,0.7339129,0.0002002297],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0003387186,0.9935086,0.004078889,0.0006635414,0.0003717977,0.00005881629,0.0001478952,0.00002733769,0.00080441],"genre_scores_gemma":[0.00496723,0.9879692,0.005086627,0.000583855,0.000492858,0.0001292346,0.0003351028,0.00001804191,0.0004178412],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.006368442,"threshold_uncertainty_score":0.02449852,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2167793421","doi":"10.1145/347090.347126","title":"Explicitly representing expected cost","year":2000,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":186,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true},"ca_institutions":"University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Citation; Library science; Computer science; Information technology; Operations research; Engineering","authors":[{"name":"Chris Drummond","is_ca":true},{"name":"Robert C. Holte","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02325582657334252,"gpt":0.2720641851169671,"spread":0.2488083585436245,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004282702,0.001303648,0.001062646,0.002629582,0.0007139944,0.006326205,0.002239843,0.002037547,0.02068496],"category_scores_gemma":[0.04702812,0.000525997,0.001662859,0.004743356,0.001163835,0.01206721,0.002043473,0.002781762,0.003266948],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002499146,"about_ca_system_score_gemma":0.002006141,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006236659,"about_ca_topic_score_gemma":0.004632039,"domain_scores_codex":[0.9948024,0.002189581,0.0004089076,0.0007634009,0.001478828,0.0003570125],"domain_scores_gemma":[0.9810587,0.01045805,0.001682128,0.004141749,0.002286711,0.0003726237],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002477487,0.0001459921,0.002913485,0.000202084,0.00009492956,0.0002737116,0.0002660722,0.1986027,0.0006056704,0.5889592,0.019631,0.1880575],"study_design_scores_gemma":[0.00002057911,0.00006010414,0.0005381531,0.00009147429,0.00005555402,0.0001604378,0.00008420169,0.6085274,0.000600616,0.3660557,0.02376435,0.0000414879],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01189897,0.0005303993,0.9581773,0.001888781,0.0004221922,0.00008973933,0.001264838,0.001084297,0.02464341],"genre_scores_gemma":[0.5495895,0.001170218,0.4256527,0.0005792878,0.000854162,0.0003237919,0.002796354,0.001043962,0.01798998],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02068496,"threshold_uncertainty_score":0.06919807,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3186924568","doi":"10.1109/access.2021.3096799","title":"Intelligent Fraud Detection in Financial Statements Using Machine Learning and Data Mining: A Systematic Literature Review","year":2021,"lang":"en","type":"article","venue":"IEEE Access","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":186,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Audit; Cluster analysis; Anomaly detection; Unsupervised learning; Focus (optics); Key (lock); Machine learning; Heuristic; Finance; Artificial intelligence; Data mining; Data science; Accounting; Computer security; Business","authors":[{"name":"Matin N. Ashtiani","is_ca":true},{"name":"Bijan Raahemi","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09531188645907628,"gpt":0.4084828426708726,"spread":0.3131709562117964,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007627416,0.001041464,0.002538325,0.02255045,0.0006255258,0.002366561,0.001220147,0.001446674,0.001953808],"category_scores_gemma":[0.0348928,0.0006538308,0.002664011,0.01820759,0.0009336055,0.00333824,0.0012773,0.0009649305,0.0003992489],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00150975,"about_ca_system_score_gemma":0.009812518,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003212642,"about_ca_topic_score_gemma":0.008329825,"domain_scores_codex":[0.995252,0.001452705,0.001659965,0.0003917468,0.001126958,0.0001166236],"domain_scores_gemma":[0.9559558,0.03570063,0.004032455,0.0005819711,0.003458007,0.0002711442],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"systematic_review","study_design_scores_codex":[0.00009778597,0.0000891263,0.003326385,0.426457,0.001815731,0.0002914763,0.0005641192,0.0007743805,0.0004239366,0.002105182,0.00593513,0.5581198],"study_design_scores_gemma":[0.00005272328,0.0002216691,0.008154877,0.8248314,0.01181479,0.001153105,0.0009493188,0.001108618,0.0009715028,0.003470693,0.1471749,0.00009649786],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.001428973,0.9957445,0.00115606,0.0006097242,0.00009870282,0.0001375942,0.0002720585,0.00001364752,0.0005387149],"genre_scores_gemma":[0.008900918,0.9873456,0.002819014,0.0003411594,0.00007783954,0.0001561885,0.0002614904,0.000006106978,0.00009168092],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.02255045,"threshold_uncertainty_score":0.0403381,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1982672081","doi":"10.5539/gjhs.v7n1p194","title":"Using Data Mining to Detect Health Care Fraud and Abuse: A Review of Literature","year":2014,"lang":"en","type":"review","venue":"Global Journal of Health Science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":154,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false},"ca_institutions":"","funders":"Tehran University of Medical Sciences and Health Services","keywords":"Context (archaeology); Health care; Payment; Knowledge extraction; Data science; Data mining; Computer science; Service (business); Business; Political science; World Wide Web","authors":[{"name":"Hossein Joudaki","is_ca":false},{"name":"Arash Rashidian","is_ca":false},{"name":"Behrouz Minaei‐Bidgoli","is_ca":false},{"name":"Mahmood Mahmoodi","is_ca":false},{"name":"Bijan Geraili","is_ca":false},{"name":"Mahdi Nasiri","is_ca":false},{"name":"Mohammad Arab","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1291464525878868,"gpt":0.4738601705266665,"spread":0.3447137179387796,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004228524,0.001042382,0.001988146,0.01043386,0.0005039803,0.001827229,0.001811708,0.001635825,0.001340301],"category_scores_gemma":[0.01117387,0.0005393259,0.001551458,0.01242027,0.0009633619,0.002961119,0.0008119034,0.001529276,0.0007374433],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001275616,"about_ca_system_score_gemma":0.003162019,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002470526,"about_ca_topic_score_gemma":0.003124716,"domain_scores_codex":[0.9981632,0.0003832101,0.0003870992,0.0002665423,0.0007392189,0.0000608724],"domain_scores_gemma":[0.9873143,0.009347541,0.001004467,0.0002197646,0.001952468,0.0001614881],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004428993,0.0001018475,0.002113032,0.03215199,0.0003192081,0.00009572921,0.0001427149,0.0006302572,0.000293762,0.00321996,0.01325681,0.9476304],"study_design_scores_gemma":[0.00006663829,0.0002951265,0.01616543,0.1149746,0.002247089,0.002822365,0.001111722,0.003029878,0.001974522,0.02497092,0.8321602,0.000181465],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0003049232,0.9971476,0.0009755437,0.0008495312,0.0001318097,0.00001941294,0.00005122044,0.00001421536,0.0005057514],"genre_scores_gemma":[0.002290395,0.9950693,0.001986968,0.0003049409,0.0001406073,0.00002629085,0.00006699756,0.000003190571,0.0001112727],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.01043386,"threshold_uncertainty_score":0.02236283,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2166045895","doi":"10.1007/11731139_15","title":"Boosting Prediction Accuracy on Imbalanced Datasets with SVM Ensembles","year":2006,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":149,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"York University","funders":"","keywords":"Boosting (machine learning); Computer science; Support vector machine; Artificial intelligence; Machine learning; Data mining; Sampling (signal processing); Context (archaeology); Ensemble learning; Oversampling; Pattern recognition (psychology); Data sampling; Bandwidth (computing)","authors":[{"name":"Yang Liu","is_ca":true},{"name":"Aijun An","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0174732329986504,"gpt":0.253741026703638,"spread":0.2362677937049876,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0068789,0.001302327,0.002099989,0.001490589,0.0003855068,0.001055038,0.00125803,0.001176957,0.000983529],"category_scores_gemma":[0.01454568,0.0005235376,0.0008439003,0.001158127,0.0003539684,0.00235027,0.001444054,0.002199244,0.001041979],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004261023,"about_ca_system_score_gemma":0.0004584527,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001105986,"about_ca_topic_score_gemma":0.001473472,"domain_scores_codex":[0.9978362,0.0007862785,0.0001229278,0.0003441338,0.0007171502,0.0001933863],"domain_scores_gemma":[0.9911702,0.004976322,0.0003201117,0.001534261,0.001793308,0.0002059059],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009591361,0.0004877168,0.01432199,0.0001546918,0.0003779512,0.00009737578,0.00009083235,0.3001433,0.007079797,0.002450825,0.01544561,0.6583908],"study_design_scores_gemma":[0.00001443568,0.00008399004,0.001357042,0.00001162746,0.00003902199,0.00003108897,0.000009164651,0.99361,0.002081124,0.002349468,0.0004059249,0.00000709808],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3218287,0.003910728,0.6611638,0.001013833,0.001152109,0.0001577795,0.0005406148,0.003431909,0.0068005],"genre_scores_gemma":[0.8847052,0.0006056139,0.1102261,0.0002250179,0.000629677,0.00008557748,0.0009395985,0.0001956541,0.002387657],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0068789,"threshold_uncertainty_score":0.03637952,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2157751754","doi":"10.1109/tkde.2006.131","title":"Test strategies for cost-sensitive decision trees","year":2006,"lang":"en","type":"article","venue":"IEEE Transactions on Knowledge and Data Engineering","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":145,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"Natural Sciences and Engineering Research Council of Canada; Hong Kong University of Science and Technology","keywords":"Computer science; Medical diagnosis; Decision tree; Machine learning; Test (biology); Artificial intelligence; Test case; Process (computing); Medical costs; Data mining; Health care; Medicine","authors":[{"name":"Charles X. Ling","is_ca":true},{"name":"Victor S. Sheng","is_ca":true},{"name":"Qiang Yang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02750885075641095,"gpt":0.2859938931044155,"spread":0.2584850423480046,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007781953,0.001092864,0.001188462,0.001620086,0.0005341926,0.001189397,0.002172521,0.001730973,0.001797442],"category_scores_gemma":[0.03599237,0.0004882198,0.000577639,0.00102549,0.001073803,0.002969886,0.001227765,0.001445732,0.0002842043],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00130321,"about_ca_system_score_gemma":0.001230924,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00148555,"about_ca_topic_score_gemma":0.0013073,"domain_scores_codex":[0.9949924,0.003112132,0.000310227,0.0004144892,0.0009444717,0.0002262974],"domain_scores_gemma":[0.9725062,0.02344914,0.0009926545,0.000857797,0.001812992,0.0003813519],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0005287331,0.0003975281,0.005849201,0.0002089638,0.0001331705,0.000288524,0.0002483365,0.6964708,0.002382136,0.05256984,0.002631424,0.2382913],"study_design_scores_gemma":[0.0000548413,0.000108452,0.0002303372,0.00001690224,0.00002067982,0.00004571373,0.00001977734,0.9624189,0.001105007,0.03561632,0.0003523176,0.0000106817],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06898145,0.0006586039,0.9269359,0.0007223111,0.00004199526,0.0003589235,0.0001284137,0.0006175368,0.001554811],"genre_scores_gemma":[0.7107391,0.0001996045,0.2871736,0.0003800477,0.00005016589,0.000427791,0.0002686971,0.00008477883,0.0006762366],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007781953,"threshold_uncertainty_score":0.0411554,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4388099759","doi":"10.1016/j.eswa.2023.122156","title":"Financial fraud detection using graph neural networks: A systematic review","year":2023,"lang":"en","type":"review","venue":"Expert Systems with Applications","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":144,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Wilfrid Laurier University; University of Ottawa","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Computer science; Graph; Artificial neural network; Artificial intelligence; Machine learning; Theoretical computer science","authors":[{"name":"Bijan Raahemi","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06262470066207466,"gpt":0.3396527258724665,"spread":0.2770280252103919,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006089294,0.001343928,0.004883243,0.008125808,0.0004024787,0.002039836,0.002188282,0.001520631,0.003440882],"category_scores_gemma":[0.03133549,0.0005719428,0.004421169,0.006847185,0.0008332419,0.002563997,0.001237646,0.001181137,0.0003982391],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00141776,"about_ca_system_score_gemma":0.004939363,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004051532,"about_ca_topic_score_gemma":0.01493746,"domain_scores_codex":[0.996783,0.001100588,0.000884044,0.0003486075,0.0008140844,0.00006962369],"domain_scores_gemma":[0.9823139,0.01367751,0.002233208,0.0002843728,0.001340471,0.0001505063],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"systematic_review","study_design_scores_codex":[0.0003202207,0.00009157657,0.002696677,0.3698028,0.009754799,0.0001090318,0.000103217,0.0007231575,0.0001595294,0.0008858114,0.009572819,0.6057804],"study_design_scores_gemma":[0.0006556896,0.0007247751,0.01118863,0.7553541,0.09850694,0.001439527,0.0004969825,0.002684362,0.0008203189,0.006581341,0.1213734,0.0001738553],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0006347402,0.9980107,0.0004098169,0.0003604669,0.0001052841,0.00007928715,0.0001739615,0.000008074073,0.0002177503],"genre_scores_gemma":[0.007595098,0.9904866,0.001146335,0.0003644845,0.0000832348,0.00007258823,0.0001559809,0.00000446777,0.00009113003],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.008125808,"threshold_uncertainty_score":0.03220367,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W83133245","doi":"","title":"Thresholding for making classifiers cost-sensitive","year":2006,"lang":"en","type":"article","venue":"National Conference on Artificial Intelligence","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":143,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Western University","funders":"","keywords":"Thresholding; Computer science; Artificial intelligence; Balanced histogram thresholding; Pattern recognition (psychology); Machine learning; Sensitivity (control systems); Histogram; Image (mathematics); Engineering","authors":[{"name":"Victor S. Sheng","is_ca":true},{"name":"Charles X. Ling","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1945087779740975,"gpt":0.3871194660419463,"spread":0.1926106880678488,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009167881,0.001937179,0.002168639,0.003167647,0.00101623,0.003239883,0.003135898,0.002757537,0.002509309],"category_scores_gemma":[0.04671058,0.001282483,0.001396091,0.001766263,0.001973203,0.005637625,0.003133337,0.003937451,0.0009934234],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001963334,"about_ca_system_score_gemma":0.001248897,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008799662,"about_ca_topic_score_gemma":0.000691357,"domain_scores_codex":[0.9903307,0.002913386,0.0008125152,0.001722633,0.003745459,0.0004753047],"domain_scores_gemma":[0.9812152,0.01033852,0.00176062,0.00333524,0.003054815,0.0002956168],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004675435,0.000205309,0.003720352,0.0005992823,0.0004874461,0.000283935,0.0004225257,0.3231019,0.02860122,0.09851247,0.005449309,0.5381488],"study_design_scores_gemma":[0.00004375045,0.0002015123,0.0007651626,0.0001118073,0.0002178963,0.0003534169,0.00006671725,0.8632242,0.0229082,0.1058112,0.006219705,0.00007639649],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.009597516,0.0004960562,0.9876705,0.000292204,0.0001064443,0.00008574943,0.00003776533,0.0005042009,0.001209409],"genre_scores_gemma":[0.3739863,0.0005500237,0.6211317,0.0007124763,0.0003078154,0.0004180303,0.0002460374,0.0004270351,0.002220675],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.009167881,"threshold_uncertainty_score":0.04848498,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2152325113","doi":"10.1007/3-540-45153-6_7","title":"Concept-Learning in the Presence of Between-Class and Within-Class Imbalances","year":2001,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":136,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Class (philosophy); Focus (optics); Sampling (signal processing); Artificial intelligence; Mechanism (biology); Order (exchange); Machine learning; Theoretical computer science; Epistemology; Telecommunications","authors":[{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02099275441995642,"gpt":0.2643135857297962,"spread":0.2433208313098398,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02644103,0.001088561,0.003117223,0.001750993,0.001247521,0.003510382,0.00368997,0.002514319,0.001559545],"category_scores_gemma":[0.07205638,0.001159785,0.001036886,0.002765271,0.002224645,0.01030982,0.00505912,0.005573648,0.0004887932],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0012216,"about_ca_system_score_gemma":0.001240634,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001250955,"about_ca_topic_score_gemma":0.001184819,"domain_scores_codex":[0.9919891,0.003722982,0.0004168999,0.001481409,0.00194257,0.0004471131],"domain_scores_gemma":[0.9093193,0.08008317,0.002363579,0.00390016,0.003359524,0.000974307],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001032222,0.0003750334,0.009493275,0.0006968885,0.0004154691,0.000731525,0.001262907,0.3135857,0.002845181,0.1558156,0.01015982,0.5035863],"study_design_scores_gemma":[0.00003285927,0.00004997532,0.0005368082,0.00002056438,0.00003068487,0.0001357421,0.00006362559,0.8724151,0.000761222,0.1250221,0.0009152671,0.00001611867],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03896733,0.001328973,0.9569432,0.0008367594,0.0001474695,0.00005854525,0.0001044719,0.0002967276,0.001316538],"genre_scores_gemma":[0.5945489,0.001259691,0.3972162,0.0005003861,0.0009775887,0.0003402889,0.0006887812,0.0002069556,0.004261263],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.02644103,"threshold_uncertainty_score":0.1398352,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1541033774","doi":"10.1007/978-3-642-13059-5_22","title":"Overlap versus Imbalance","year":2010,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":134,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Dalhousie University","funders":"","keywords":"Computer science; Classifier (UML); Interdependence; Training set; Isolation (microbiology); Artificial intelligence; Machine learning; Pattern recognition (psychology)","authors":[{"name":"Misha Denil","is_ca":true},{"name":"Thomas Trappenberg","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02038288687829102,"gpt":0.2655751414727915,"spread":0.2451922545945005,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003989602,0.001088802,0.001608358,0.002411784,0.001527661,0.004001568,0.00185776,0.001429617,0.01931017],"category_scores_gemma":[0.02321486,0.0006253642,0.0007187393,0.00361344,0.002395595,0.01093207,0.004873158,0.00260278,0.005769542],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00102984,"about_ca_system_score_gemma":0.0007940763,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004214318,"about_ca_topic_score_gemma":0.0004971123,"domain_scores_codex":[0.9947358,0.001471322,0.0002804399,0.001149135,0.001988999,0.0003743755],"domain_scores_gemma":[0.9892401,0.005918358,0.0004993114,0.00277828,0.001167546,0.0003964608],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003707466,0.00009109708,0.001758012,0.0002856544,0.0000539597,0.0001019567,0.0003913352,0.005504302,0.001909771,0.4939887,0.03963352,0.455911],"study_design_scores_gemma":[0.00002450143,0.0000883078,0.001047607,0.000108224,0.00004929551,0.000671678,0.0002585278,0.04703631,0.004369021,0.8642438,0.08207577,0.00002687711],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0306743,0.008922033,0.8424236,0.005536315,0.00194689,0.0001881902,0.0009392523,0.001646961,0.1077224],"genre_scores_gemma":[0.5730159,0.007266629,0.2824387,0.002226221,0.006134871,0.0006759784,0.003132415,0.001772235,0.123337],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01931017,"threshold_uncertainty_score":0.06459898,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2912895282","doi":"10.1016/j.neucom.2018.11.100","title":"Pre-processing approaches for imbalanced distributions in regression","year":2019,"lang":"en","type":"article","venue":"Neurocomputing","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":130,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Dalhousie University","funders":"European Regional Development Fund; Fundação para a Ciência e a Tecnologia","keywords":"Computer science; Regression; Machine learning; Variable (mathematics); Relevance (law); Regression analysis; Artificial intelligence; Context (archaeology); Feature selection; Set (abstract data type); Data mining; Mathematics; Statistics","authors":[{"name":"Paula Branco","is_ca":false},{"name":"Luı́s Torgo","is_ca":true},{"name":"Rita P. Ribeiro","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03953302892903467,"gpt":0.2872695688861338,"spread":0.2477365399570991,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006765726,0.001689174,0.002104245,0.00272383,0.001422967,0.002539647,0.0027021,0.001419364,0.007544813],"category_scores_gemma":[0.01728646,0.0008678383,0.002001711,0.003186472,0.0009122516,0.002798201,0.002581283,0.005103996,0.004465091],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007177599,"about_ca_system_score_gemma":0.002155863,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00248787,"about_ca_topic_score_gemma":0.004555999,"domain_scores_codex":[0.9967638,0.0007699267,0.0003820173,0.0005956788,0.001197802,0.0002907174],"domain_scores_gemma":[0.9902263,0.004381272,0.0005362037,0.001850899,0.002780992,0.0002243567],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004790005,0.0004237845,0.002719666,0.0003663182,0.0001974787,0.0001692327,0.0002579314,0.06144957,0.01449575,0.01675215,0.01055199,0.8921373],"study_design_scores_gemma":[0.00005288128,0.0001845742,0.002600488,0.00007893841,0.0001025256,0.0001711487,0.0001622221,0.9387017,0.0180889,0.02725287,0.01256123,0.00004258295],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005711281,0.0004913274,0.9913619,0.0002453541,0.0001721718,0.0001158313,0.0001588023,0.001099316,0.0006439079],"genre_scores_gemma":[0.1206556,0.0009245244,0.8690892,0.0003057187,0.0008034613,0.0005035522,0.001785739,0.0005818388,0.005350336],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007544813,"threshold_uncertainty_score":0.03578097,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3207601856","doi":"10.1038/s41592-021-01302-4","title":"The class imbalance problem","year":2021,"lang":"en","type":"article","venue":"Nature Methods","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":126,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canada's Michael Smith Genome Sciences Centre","funders":"","keywords":"Class (philosophy); Computational biology; Computer science; Biology; Chemistry; Artificial intelligence","authors":[{"name":"Fadel M. Megahed","is_ca":false},{"name":"Ying‐Ju Chen","is_ca":false},{"name":"Aly Megahed","is_ca":false},{"name":"Yuya Jeremy Ong","is_ca":false},{"name":"Naomi Altman","is_ca":false},{"name":"Martin Krzywinski","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01395549485720575,"gpt":0.3723376864885252,"spread":0.3583821916313195,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008079479,0.001320605,0.001937911,0.002770375,0.002218923,0.004705153,0.002815435,0.00325899,0.005627441],"category_scores_gemma":[0.02939067,0.0007376373,0.001395862,0.003267115,0.002314137,0.006263892,0.003822938,0.005574533,0.002771192],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001232632,"about_ca_system_score_gemma":0.00153258,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0006840087,"about_ca_topic_score_gemma":0.0006953332,"domain_scores_codex":[0.9886464,0.003408674,0.0004466336,0.002840033,0.00424651,0.0004117694],"domain_scores_gemma":[0.9827659,0.01084167,0.001362412,0.002627604,0.001967031,0.0004355209],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002605738,0.0002230535,0.006433096,0.000597191,0.0002735753,0.0003465239,0.0003109282,0.01676417,0.003162766,0.2504852,0.09247631,0.6286667],"study_design_scores_gemma":[0.00007354764,0.0001172841,0.003758243,0.0002222251,0.0001278027,0.001676475,0.0002803028,0.2131863,0.005262394,0.6668453,0.1083855,0.00006467552],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0133427,0.006339598,0.9433529,0.008021293,0.00241732,0.0002650016,0.0009775934,0.0006976541,0.02458594],"genre_scores_gemma":[0.4651839,0.01092945,0.4414906,0.008034532,0.01424857,0.001470771,0.004920753,0.0006609972,0.05306039],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.008079479,"threshold_uncertainty_score":0.0427289,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3139397034","doi":"10.1109/access.2021.3068614","title":"The Benefits of the Matthews Correlation Coefficient (MCC) Over the Diagnostic Odds Ratio (DOR) in Binary Classification Assessment","year":2021,"lang":"en","type":"article","venue":"IEEE Access","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":108,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"Magyar Tudományos Akadémia; University of Southampton; Belarusian Republican Foundation for Fundamental Research","keywords":"Contingency table; False positive paradox; Computer science; Confusion; Kappa; Confusion matrix; Artificial intelligence; Correlation coefficient; Statistics; Correlation; Data mining; Mathematics; Machine learning; Psychology","authors":[{"name":"Davide Chicco","is_ca":true},{"name":"В. В. Старовойтов","is_ca":false},{"name":"Giuseppe Jurman","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03775231095962638,"gpt":0.3249331132441325,"spread":0.2871808022845061,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07559287,0.002420013,0.002581493,0.01994473,0.002068654,0.005553326,0.002076886,0.003143945,0.001717371],"category_scores_gemma":[0.337135,0.0007283366,0.00173776,0.01428929,0.005832612,0.005786739,0.004757175,0.003793158,0.0008866983],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002713126,"about_ca_system_score_gemma":0.002720363,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005588192,"about_ca_topic_score_gemma":0.005784216,"domain_scores_codex":[0.9151787,0.04571934,0.009803331,0.01174241,0.0166951,0.0008611576],"domain_scores_gemma":[0.5796528,0.3451814,0.03006835,0.01969668,0.02292696,0.002473744],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001381197,0.0001936833,0.3363019,0.002899016,0.003828669,0.001139804,0.003773888,0.03011442,0.004058939,0.1172728,0.03329439,0.4657413],"study_design_scores_gemma":[0.0002771126,0.002407725,0.2454051,0.002327842,0.00213928,0.007200753,0.003336716,0.2152511,0.013825,0.4415178,0.06478796,0.001523516],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1253475,0.03472468,0.7938021,0.009912996,0.002775609,0.0008411826,0.003682369,0.002971377,0.02594236],"genre_scores_gemma":[0.7214788,0.004820824,0.2649333,0.001860808,0.002041773,0.0009144596,0.00120975,0.0006564281,0.002083924],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9244071,"threshold_uncertainty_score":0.3997781,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1608531804","doi":"10.1007/978-3-642-01818-3_25","title":"Evaluation Methods for Ordinal Classification","year":2009,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":106,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Computer science; Metric (unit); Class (philosophy); Mean absolute error; Ordinal regression; Mean squared error; Ordinal data; Data mining; Statistics; Artificial intelligence; Machine learning; Pattern recognition (psychology); Algorithm; Mathematics","authors":[{"name":"Lisa Gaudette","is_ca":true},{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08103451214580921,"gpt":0.3884510258369434,"spread":0.3074165136911342,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03144125,0.001471347,0.002347339,0.004841222,0.0009793993,0.003894813,0.002840663,0.001475722,0.0103293],"category_scores_gemma":[0.0807716,0.0005059075,0.001435021,0.004981811,0.00135253,0.006518264,0.002523465,0.003500704,0.002524822],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001734944,"about_ca_system_score_gemma":0.001316856,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000947267,"about_ca_topic_score_gemma":0.001152791,"domain_scores_codex":[0.9701927,0.01844623,0.001968002,0.001868563,0.006987528,0.000537012],"domain_scores_gemma":[0.9275888,0.05548404,0.002011257,0.006939809,0.007219905,0.0007560898],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0005968019,0.0002230075,0.004500194,0.0008482598,0.0003800214,0.00003803297,0.0001587878,0.02250489,0.0008104232,0.1025719,0.02589632,0.8414714],"study_design_scores_gemma":[0.0001249412,0.0004593809,0.003903741,0.0004826565,0.0002686883,0.0002323884,0.0002009196,0.540796,0.002148817,0.4275893,0.02372276,0.00007041438],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005029871,0.007562499,0.9794773,0.0006626557,0.000429497,0.0002123032,0.000800854,0.0009762611,0.004848629],"genre_scores_gemma":[0.2054503,0.003663526,0.7701982,0.0004319604,0.001294397,0.001547619,0.004843378,0.0007895806,0.01178091],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.03144125,"threshold_uncertainty_score":0.1662791,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4402194596","doi":"10.1057/s41599-024-03606-0","title":"Financial fraud detection through the application of machine learning techniques: a literature review","year":2024,"lang":"en","type":"review","venue":"Humanities and Social Sciences Communications","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":103,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true},"ca_institutions":"","funders":"","keywords":"Computer science; Finance; Artificial intelligence; Machine learning; Business","authors":[{"name":"Ludivia Hernández Aros","is_ca":false},{"name":"Luisa Ximena Bustamante Molano","is_ca":false},{"name":"Fernando Gutiérrez-Portela","is_ca":false},{"name":"John Johver Moreno Hernandez","is_ca":false},{"name":"Mario Samuel Rodríguez Barrero","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1239832197598417,"gpt":0.3835576234455726,"spread":0.2595744036857309,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002984755,0.0009913613,0.001620702,0.01030068,0.0005404367,0.001742857,0.001142381,0.001412125,0.002172548],"category_scores_gemma":[0.009508126,0.0005256993,0.001372603,0.0100886,0.000573207,0.002332516,0.0007632174,0.0009576579,0.0006723551],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009471925,"about_ca_system_score_gemma":0.003524668,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0019479,"about_ca_topic_score_gemma":0.002956568,"domain_scores_codex":[0.998624,0.0003415809,0.000310688,0.0001653108,0.0004928527,0.00006557922],"domain_scores_gemma":[0.9903736,0.006755606,0.0009249334,0.0001397432,0.001661948,0.0001442181],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"systematic_review","study_design_scores_codex":[0.00006842531,0.0001010209,0.001355376,0.08616082,0.0004053886,0.0001974636,0.000171018,0.000558843,0.0004448922,0.002045111,0.01113893,0.8973528],"study_design_scores_gemma":[0.00005752879,0.0004555998,0.01107959,0.2078977,0.004372588,0.003405966,0.0008805284,0.001851883,0.00235429,0.006259651,0.7612502,0.0001344079],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.0004026838,0.9980866,0.0003729856,0.0003917603,0.0001167162,0.00001807769,0.00002691639,0.000007004339,0.0005773372],"genre_scores_gemma":[0.002173656,0.9968854,0.0005592947,0.0001445279,0.0001034973,0.00001400349,0.00002921358,0.000001886133,0.00008855747],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.01030068,"threshold_uncertainty_score":0.0157851,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1851653583","doi":"10.1007/s10994-015-5535-7","title":"Learning to identify relevant studies for systematic reviews using random forest and external information","year":2015,"lang":"en","type":"article","venue":"Machine Learning","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":98,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Random forest; Computer science; Heuristics; Machine learning; Classifier (UML); Artificial intelligence; Cluster analysis; Systematic review; Class (philosophy); Recall; USable; Task (project management); Data mining; Information retrieval; Natural language processing; World Wide Web","authors":[{"name":"Madian Khabsa","is_ca":false},{"name":"Ahmed K. Elmagarmid","is_ca":false},{"name":"Ihab F. Ilyas","is_ca":true},{"name":"Hossam M. Hammady","is_ca":false},{"name":"Mourad Ouzzani","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09096737967275106,"gpt":0.3815705795832492,"spread":0.2906031999104981,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1849895,0.005753219,0.01757909,0.04652081,0.002354458,0.006636673,0.005025201,0.004101497,0.007545852],"category_scores_gemma":[0.4840657,0.002292073,0.02496883,0.01792799,0.002084471,0.007863043,0.005558532,0.004211807,0.001685498],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003399175,"about_ca_system_score_gemma":0.01237493,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003095452,"about_ca_topic_score_gemma":0.00919322,"domain_scores_codex":[0.8165774,0.1079019,0.04521941,0.01441708,0.0149835,0.0009006847],"domain_scores_gemma":[0.34864,0.5865281,0.03030043,0.01885713,0.01405245,0.001621852],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004777266,0.0009337264,0.02502521,0.2635788,0.08095103,0.001002849,0.001728549,0.02183109,0.0028123,0.008031781,0.02511355,0.5642139],"study_design_scores_gemma":[0.0111278,0.004142092,0.01878856,0.1249988,0.3188915,0.002045193,0.00128715,0.2671984,0.00754222,0.1971214,0.04605855,0.0007983935],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03310554,0.1649452,0.7132946,0.006882929,0.001751527,0.03918669,0.03231756,0.005042647,0.003473354],"genre_scores_gemma":[0.216537,0.01794181,0.7085589,0.00225678,0.001018028,0.03696463,0.01552054,0.0003580817,0.0008442601],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8150105,"threshold_uncertainty_score":0.9783294,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2108197782","doi":"10.1016/j.jbi.2004.07.008","title":"Classification and knowledge discovery in protein databases","year":2004,"lang":"en","type":"article","venue":"Journal of Biomedical Informatics","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":93,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Canadian Imperial Bank of Commerce (Canada)","funders":"U.S. National Library of Medicine; National Institutes of Health; National Science Foundation","keywords":"Artificial intelligence; Computer science; Machine learning; Feature selection; Cluster analysis; Robustness (evolution); Pattern recognition (psychology); Data mining; Ensemble learning","authors":[{"name":"Predrag Radivojac","is_ca":false},{"name":"Nitesh V. Chawla","is_ca":true},{"name":"A. Keith Dunker","is_ca":false},{"name":"Zoran Obradović","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03453498297277332,"gpt":0.3070496474201495,"spread":0.2725146644473762,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01244732,0.0006237199,0.001991842,0.006942687,0.001623338,0.005354436,0.002349548,0.001607962,0.001069883],"category_scores_gemma":[0.03606366,0.0006959006,0.001336232,0.007221388,0.001713322,0.00941187,0.002217537,0.002321245,0.0005485506],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001661566,"about_ca_system_score_gemma":0.002221102,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002386167,"about_ca_topic_score_gemma":0.002074064,"domain_scores_codex":[0.9910309,0.002850659,0.001466529,0.0009133587,0.003372943,0.000365732],"domain_scores_gemma":[0.9747406,0.01681922,0.001983473,0.003216858,0.002691934,0.0005478392],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008758104,0.001022223,0.02297474,0.001094765,0.0004063155,0.0004525206,0.0007758418,0.0489338,0.006486452,0.05513838,0.0121122,0.8497269],"study_design_scores_gemma":[0.00007283623,0.0001482363,0.006015363,0.0001510897,0.000190296,0.000541108,0.0005377266,0.7441092,0.01108024,0.2271231,0.009989551,0.000041309],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1621005,0.01449006,0.8075101,0.008454653,0.0006447158,0.0003315862,0.001869023,0.001764063,0.002835335],"genre_scores_gemma":[0.5901968,0.005670602,0.396016,0.0007799778,0.0008063014,0.0002919825,0.003654541,0.0001194948,0.002464355],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01244732,"threshold_uncertainty_score":0.06582844,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2294246171","doi":"10.5220/0005595502260234","title":"SCUT: Multi-Class Imbalanced Data Classification using SMOTE and Cluster-based Undersampling","year":2015,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":90,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"National Research Council Canada; University of Ottawa","funders":"","keywords":"Undersampling; Computer science; Class (philosophy); Cluster (spacecraft); Support vector machine; Artificial intelligence; Data mining; Multi-label classification; Pattern recognition (psychology); Computer network","authors":[{"name":"Astha Agrawal","is_ca":true},{"name":"Herna L. Viktor","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.3499846869511297,"gpt":0.3807716212091559,"spread":0.03078693425802626,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004934186,0.001318648,0.001723906,0.002238544,0.001174724,0.001218105,0.002146319,0.001765804,0.0009735911],"category_scores_gemma":[0.008991519,0.000601944,0.001682231,0.001477776,0.001099721,0.001321511,0.001800539,0.002419544,0.0004962764],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001083261,"about_ca_system_score_gemma":0.002084604,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006777094,"about_ca_topic_score_gemma":0.009557269,"domain_scores_codex":[0.9982698,0.000600612,0.0001313201,0.0003104745,0.000519762,0.0001678994],"domain_scores_gemma":[0.9966525,0.001548704,0.0003063965,0.0004636285,0.0008779867,0.0001507102],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000919441,0.0006142012,0.01061152,0.000357544,0.0005229737,0.0002280285,0.0003482784,0.5244824,0.01054303,0.007679086,0.01418823,0.4295053],"study_design_scores_gemma":[0.00001670829,0.0000345601,0.0003601915,0.000007161501,0.000009038105,0.00001690585,0.00001446693,0.9963763,0.001375669,0.001169999,0.0006129005,0.000005992155],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05118486,0.0005368831,0.9420434,0.0003908524,0.0002290101,0.0004049253,0.0003163185,0.00395708,0.0009366328],"genre_scores_gemma":[0.3319378,0.0002552495,0.6616488,0.000483011,0.0002038577,0.0007294163,0.002599428,0.0003118632,0.001830611],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006777094,"threshold_uncertainty_score":0.02609479,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1967158716","doi":"10.1109/icmla.2012.212","title":"One-Class versus Binary Classification: Which and When?","year":2012,"lang":"en","type":"article","venue":"","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":88,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Ottawa","funders":"","keywords":"Binary number; Binary classification; Artificial intelligence; Class (philosophy); Computer science; Machine learning; Pattern recognition (psychology); Multiclass classification; One-class classification; Classifier (UML); Support vector machine; Data mining; Mathematics","authors":[{"name":"Colin Bellinger","is_ca":true},{"name":"Shiven Sharma","is_ca":true},{"name":"Nathalie Japkowicz","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0767719356677637,"gpt":0.2971836471206444,"spread":0.2204117114528807,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0339679,0.001240786,0.002792489,0.003003229,0.001817549,0.007833892,0.002764698,0.005001494,0.003473256],"category_scores_gemma":[0.1087786,0.0005237278,0.001184075,0.004672506,0.005524413,0.02031008,0.002652528,0.005746502,0.002916059],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002160483,"about_ca_system_score_gemma":0.001425186,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001538859,"about_ca_topic_score_gemma":0.002371924,"domain_scores_codex":[0.9760765,0.01235164,0.001321941,0.004067673,0.005308862,0.0008734164],"domain_scores_gemma":[0.9246567,0.0500644,0.00647663,0.005482862,0.01073158,0.002587811],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001768682,0.0004998618,0.02618521,0.001459433,0.0003227541,0.0001499259,0.001415218,0.003777315,0.002852213,0.07707602,0.05824384,0.8262494],"study_design_scores_gemma":[0.0004239154,0.0009119841,0.02395993,0.002767239,0.0004004814,0.001434191,0.005807645,0.1346673,0.01065046,0.7498019,0.06870908,0.0004659098],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2032479,0.05514603,0.4956814,0.190935,0.01095593,0.001154495,0.002447786,0.001929027,0.03850245],"genre_scores_gemma":[0.7697468,0.01209361,0.1947075,0.01037982,0.005798332,0.0005828525,0.001244894,0.0009133451,0.004532808],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0339679,"threshold_uncertainty_score":0.1796415,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3113150236","doi":"10.5267/j.ac.2020.12.003","title":"The effect of artificial intelligence technologies on audit evidence","year":2020,"lang":"en","type":"article","venue":"Accounting","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":82,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false},"ca_institutions":"","funders":"","keywords":"Audit; Certification; Information technology audit; Internal audit; Knowledge management; Information technology; Business; Information security audit; Accounting; Computer science; Joint audit; Management; Computer security; Information security","authors":[{"name":"Saleh Mohammed Al-Sayyed","is_ca":false},{"name":"Shaher Falah Al-Aroud","is_ca":false},{"name":"Lena Mustafa Mahmoud Zayed","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04680938038711206,"gpt":0.3019430930530131,"spread":0.2551337126659011,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03537609,0.0003354432,0.0005098102,0.004408838,0.001026193,0.005354375,0.0008441926,0.001029029,0.002205594],"category_scores_gemma":[0.2823162,0.0003392911,0.0009211479,0.00337671,0.002094407,0.004115509,0.002177343,0.001834055,0.0002485396],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002247561,"about_ca_system_score_gemma":0.003394831,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001281568,"about_ca_topic_score_gemma":0.001099465,"domain_scores_codex":[0.9057117,0.05962769,0.008139824,0.002003651,0.0231238,0.001393487],"domain_scores_gemma":[0.2725948,0.6280475,0.05905281,0.009687756,0.02810247,0.002514539],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001840072,0.001135251,0.6257216,0.002584411,0.001072605,0.001011927,0.005808176,0.004552481,0.002436173,0.006460651,0.001569075,0.3458076],"study_design_scores_gemma":[0.00019874,0.004839764,0.9214284,0.00430242,0.001629077,0.002200287,0.01232694,0.0144241,0.00988873,0.01475947,0.01382329,0.0001788588],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.962505,0.007962946,0.0045801,0.005302753,0.0001050846,0.0002623165,0.0001734959,0.0000479692,0.01906033],"genre_scores_gemma":[0.9946413,0.001532784,0.003128358,0.0002360305,0.00004010137,0.00004256095,0.00003301828,0.000004912018,0.0003410516],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03537609,"threshold_uncertainty_score":0.1870888,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3013276295","doi":"10.1109/access.2020.2983003","title":"SMOTEFUNA: Synthetic Minority Over-Sampling Technique Based on Furthest Neighbour Algorithm","year":2020,"lang":"en","type":"article","venue":"IEEE Access","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":80,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"National Research Council Canada","funders":"European Social Fund; Magyarország Kormánya","keywords":"Computer science; Algorithm; Sampling (signal processing); Detector; Telecommunications","authors":[{"name":"Ahmad S. Tarawneh","is_ca":false},{"name":"Ahmad B. Hassanat","is_ca":false},{"name":"Khalid Almohammadi","is_ca":false},{"name":"Dmitry Chetverikov","is_ca":false},{"name":"Colin Bellinger","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06019594001374554,"gpt":0.3177182528903892,"spread":0.2575223128766436,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001613469,0.0006352267,0.001336714,0.00127949,0.0007854156,0.0006516082,0.001480325,0.0009944893,0.001225398],"category_scores_gemma":[0.004108764,0.0003071126,0.0009175731,0.000719339,0.0004604169,0.0007086233,0.0007832189,0.0009031998,0.0004501098],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004686771,"about_ca_system_score_gemma":0.001093601,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004952862,"about_ca_topic_score_gemma":0.008004157,"domain_scores_codex":[0.9993005,0.000214453,0.00005048458,0.0001336278,0.0002226439,0.00007830458],"domain_scores_gemma":[0.9986733,0.0006609334,0.0001173073,0.0001397079,0.0003552814,0.00005355084],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006519231,0.0003263388,0.009082205,0.0002283376,0.0002191335,0.0002872267,0.0003417349,0.3954651,0.02019847,0.006952003,0.007157667,0.5590899],"study_design_scores_gemma":[0.00002215779,0.00005802919,0.0004649397,0.000006257615,0.00001272235,0.00005277897,0.00002379098,0.9940857,0.002750698,0.001284692,0.001230455,0.00000768779],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08048127,0.0004490388,0.9146027,0.000161953,0.0001641587,0.0002564132,0.0001807897,0.002006595,0.001697088],"genre_scores_gemma":[0.4591708,0.0001634569,0.5363368,0.0002313962,0.00009189514,0.0004470336,0.0009493966,0.0001715415,0.002437653],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004952862,"threshold_uncertainty_score":0.009848058,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2473695717","doi":"10.48550/arxiv.1606.07558","title":"Satisfying Real-world Goals with Dataset Constraints","year":2016,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":80,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Benchmark (surveying); Real world data; Classifier (UML); Machine learning; Set (abstract data type); Training set; Data mining; Artificial intelligence; Data science","authors":[{"name":"Gabriel Goh","is_ca":false},{"name":"Andrew Cotter","is_ca":false},{"name":"Maya R. Gupta","is_ca":false},{"name":"Michael P. Friedlander","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09058333476013208,"gpt":0.224372604028407,"spread":0.1337892692682749,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01772589,0.002216163,0.002144507,0.001253226,0.001405206,0.004572876,0.003388324,0.004145375,0.002181918],"category_scores_gemma":[0.06520027,0.0009441692,0.001047964,0.002756276,0.002027887,0.008012199,0.003900417,0.00558181,0.0009370169],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002284865,"about_ca_system_score_gemma":0.003050966,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001613227,"about_ca_topic_score_gemma":0.002625657,"domain_scores_codex":[0.9895342,0.004558588,0.0007512752,0.002662535,0.001887894,0.0006055254],"domain_scores_gemma":[0.9613611,0.02435691,0.002938173,0.007001441,0.003083579,0.001258766],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005314602,0.0008104307,0.01390929,0.0007739698,0.0002442719,0.000418534,0.0005632316,0.7452857,0.005690733,0.07468919,0.02191341,0.1351698],"study_design_scores_gemma":[0.00005911299,0.0001642134,0.001940869,0.00007905644,0.00003464517,0.0002241823,0.0002044804,0.8928368,0.003618182,0.09587106,0.004932577,0.000034812],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.07348952,0.0006858164,0.9127544,0.005836175,0.0001972497,0.0003609338,0.001308036,0.0008545764,0.004513377],"genre_scores_gemma":[0.4989812,0.0004313401,0.4909529,0.002158948,0.0003727145,0.00111496,0.002392987,0.0004877592,0.003107228],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01772589,"threshold_uncertainty_score":0.09374464,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2481773658","doi":"10.1016/j.compmedimag.2016.07.011","title":"Ensemble based adaptive over-sampling method for imbalanced data learning in computer aided detection of microaneurysm","year":2016,"lang":"en","type":"article","venue":"Computerized Medical Imaging and Graphics","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":78,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"Fundamental Research Funds for the Central Universities; China Postdoctoral Science Foundation; National Natural Science Foundation of China","keywords":"Computer science; Artificial intelligence; Ensemble learning; Adaptive sampling; Sampling (signal processing); Machine learning; Pattern recognition (psychology); Training set; Computer vision; Mathematics; Monte Carlo method; Statistics","authors":[{"name":"Peng Cao","is_ca":false},{"name":"Wei Li","is_ca":false},{"name":"Dazhe Zhao","is_ca":false},{"name":"Osmar R. Zai͏̈ane","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03898227865516279,"gpt":0.3250309721664764,"spread":0.2860486935113136,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004561058,0.0006708257,0.001775561,0.001311022,0.0006973213,0.0008981267,0.001609295,0.001004457,0.000890695],"category_scores_gemma":[0.006213084,0.0003540406,0.001079132,0.001007734,0.0004306156,0.001353241,0.001197746,0.001253774,0.0002758063],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004626993,"about_ca_system_score_gemma":0.0008840645,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003283933,"about_ca_topic_score_gemma":0.003984917,"domain_scores_codex":[0.9983953,0.0005871443,0.0001576941,0.0002808648,0.0004382803,0.0001407356],"domain_scores_gemma":[0.9963878,0.001819036,0.0001818254,0.0003492631,0.001148448,0.0001135673],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006487992,0.0003607294,0.01218318,0.000146916,0.0003263167,0.0001210994,0.0002198805,0.2260031,0.008568017,0.003500413,0.003981991,0.7439396],"study_design_scores_gemma":[0.000006052347,0.00004898329,0.0009432632,0.000006166036,0.00002851949,0.00003308047,0.0000164453,0.9965603,0.001211311,0.000803673,0.0003362386,0.000005941157],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.05323819,0.001159843,0.9443369,0.0001830796,0.0001333876,0.00005278091,0.00009002729,0.0003789148,0.0004268628],"genre_scores_gemma":[0.7336312,0.0009029304,0.2618421,0.0002018156,0.0003061029,0.0001604739,0.0008224301,0.0001042965,0.002028658],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004561058,"threshold_uncertainty_score":0.02412146,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2125722086","doi":"10.1007/978-3-540-78671-9_23","title":"GP Classification under Imbalanced Data sets: Active Sub-sampling and AUC Approximation","year":2008,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":74,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Dalhousie University","funders":"Natural Sciences and Engineering Research Council of Canada; Universities Space Research Association","keywords":"Computer science; Artificial intelligence; Machine learning; Statistic; Classifier (UML); Binary classification; Estimator; Naive Bayes classifier; Boosting (machine learning); Support vector machine; Mathematics; Statistics","authors":[{"name":"John A. Doucette","is_ca":true},{"name":"Malcolm I. Heywood","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07612656226787208,"gpt":0.3049186266414283,"spread":0.2287920643735562,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01104261,0.001406395,0.003886553,0.002640394,0.0008980458,0.002385769,0.004243434,0.003519991,0.00149442],"category_scores_gemma":[0.03771827,0.0009254563,0.001683651,0.00294827,0.002144767,0.004376037,0.003452357,0.004707517,0.0004430089],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001706116,"about_ca_system_score_gemma":0.001319967,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004954002,"about_ca_topic_score_gemma":0.003273567,"domain_scores_codex":[0.9971174,0.00147563,0.0001415381,0.0004039822,0.0006513546,0.0002100735],"domain_scores_gemma":[0.981865,0.0143731,0.0004623536,0.001454017,0.001490509,0.0003550909],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005337803,0.0002872277,0.005432324,0.0003053569,0.0002174486,0.0001934405,0.0003850219,0.5801538,0.00133082,0.04669714,0.01216615,0.3522975],"study_design_scores_gemma":[0.000009350261,0.00001448034,0.00011485,0.00001035517,0.000008888484,0.00001898991,0.00000984162,0.9884859,0.0001155212,0.01097032,0.0002389351,0.000002471293],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.02717851,0.001856877,0.9674658,0.001058856,0.0001443131,0.00008980558,0.0001036981,0.0005290524,0.001573261],"genre_scores_gemma":[0.5649504,0.001528373,0.4251381,0.0009846103,0.0008950029,0.0004805085,0.001112689,0.000441394,0.00446881],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01104261,"threshold_uncertainty_score":0.05839962,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2724383523","doi":"10.1016/j.patcog.2017.06.030","title":"Online pruning of base classifiers for Dynamic Ensemble Selection","year":2017,"lang":"en","type":"article","venue":"Pattern Recognition","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":70,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université du Québec à Montréal; École de Technologie Supérieure","funders":"Coordenação de Aperfeiçoamento de Pessoal de Nível Superior","keywords":"Artificial intelligence; Random subspace method; Computer science; Classifier (UML); Machine learning; Pattern recognition (psychology); Competence (human resources); Data mining","authors":[{"name":"Dayvid V. R. Oliveira","is_ca":false},{"name":"George D. C. Cavalcanti","is_ca":false},{"name":"Robert Sabourin","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06849559556228693,"gpt":0.3224757485655906,"spread":0.2539801530033037,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003013363,0.001305238,0.002300132,0.002364939,0.001331395,0.001746639,0.002780076,0.001299463,0.003724383],"category_scores_gemma":[0.01105396,0.0006353723,0.000987313,0.001638423,0.0004910041,0.002134671,0.00208784,0.002210847,0.001830717],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007272862,"about_ca_system_score_gemma":0.001894421,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003014631,"about_ca_topic_score_gemma":0.007189937,"domain_scores_codex":[0.9979193,0.0004405863,0.0001730003,0.0003762982,0.0008401394,0.0002507505],"domain_scores_gemma":[0.9942053,0.002524382,0.0002501837,0.001169884,0.001595859,0.0002544555],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004932336,0.0004589124,0.005591052,0.0001031917,0.0001899519,0.0002162547,0.0001482541,0.07290481,0.01085236,0.004501549,0.01233283,0.8922076],"study_design_scores_gemma":[0.00003854074,0.000111567,0.001494894,0.00004197072,0.00009679433,0.0001734733,0.00005904259,0.9810987,0.005893742,0.007616105,0.003360957,0.00001412978],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07187773,0.002016686,0.918762,0.0004282011,0.0004181524,0.0002572709,0.0003890088,0.002156076,0.003694889],"genre_scores_gemma":[0.5295395,0.0007114364,0.4585463,0.0003732566,0.0004995526,0.0004845853,0.002254154,0.0004294965,0.007161653],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003724383,"threshold_uncertainty_score":0.01593637,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3186353005","doi":"10.1016/j.engappai.2023.106248","title":"Uncertainty-aware credit card fraud detection using deep learning","year":2023,"lang":"en","type":"article","venue":"Engineering Applications of Artificial Intelligence","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":66,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Concordia University","funders":"Australian Research Council","keywords":"Computer science; Credit card fraud; Process (computing); Dropout (neural networks); Confusion matrix; Machine learning; Monte Carlo method; Artificial intelligence; Deep learning; Ensemble learning; Database transaction; Credit card; Data mining; Database","authors":[{"name":"Maryam Habibpour","is_ca":false},{"name":"Hassan Gharoun","is_ca":false},{"name":"Mohammadreza Mehdipour","is_ca":false},{"name":"AmirReza Tajally","is_ca":false},{"name":"Hamzeh Asgharnezhad","is_ca":false},{"name":"Afshar Shamsi","is_ca":true},{"name":"Abbas Khosravi","is_ca":true},{"name":"Saeid Nahavandi","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03142392293625725,"gpt":0.2878609277436617,"spread":0.2564370048074044,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001572798,0.0006240303,0.001083881,0.001472526,0.0004205325,0.001315019,0.001245047,0.0009342476,0.00109044],"category_scores_gemma":[0.004305244,0.0003330837,0.0004653018,0.00110821,0.0004004135,0.001763213,0.001610501,0.001444005,0.0003643251],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008854615,"about_ca_system_score_gemma":0.001234597,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003883043,"about_ca_topic_score_gemma":0.003772928,"domain_scores_codex":[0.9992033,0.0001607291,0.00004791678,0.0001392351,0.0002549317,0.0001940015],"domain_scores_gemma":[0.9983118,0.0007225851,0.0002391976,0.0001818263,0.0004361781,0.0001084337],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006775243,0.0008977759,0.02369626,0.0001216445,0.0001816308,0.0002239403,0.0001020011,0.2592173,0.008596715,0.008885388,0.01033492,0.6870649],"study_design_scores_gemma":[0.00000440506,0.00001714552,0.0006247067,0.000005328863,0.000007460019,0.00002331642,0.000009931199,0.9952273,0.001186497,0.002594224,0.0002951695,0.000004513938],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2613802,0.001860091,0.7268146,0.002038379,0.0002874201,0.0001040331,0.0006130132,0.001580163,0.005322133],"genre_scores_gemma":[0.9637668,0.0002237781,0.03351952,0.0002038734,0.0001006997,0.00002303438,0.0003971752,0.00002098214,0.001744232],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003883043,"threshold_uncertainty_score":0.008317888,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}