{"id":"W2727112484","doi":"10.5430/air.v6n2p93","title":"Analysis of imbalanced data set problem: The case of churn prediction for telecommunication","year":2017,"lang":"en","type":"article","venue":"Artificial Intelligence Research","topic":"Customer churn and segmentation","field":"Business, Management and Accounting","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Natural Science Foundation of China","keywords":"Feature selection; Computer science; Data mining; Random forest; Feature (linguistics); Machine learning; Artificial intelligence","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004880753,0.001008921,0.001308149,0.002712412,0.0008874303,0.001043764,0.001203118,0.001427225,0.0007188329],"category_scores_gemma":[0.01062622,0.0002541103,0.001071287,0.002165698,0.0006650546,0.001419252,0.0006052174,0.001292781,0.0001290385],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001213827,"about_ca_system_score_gemma":0.0007514209,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007082934,"about_ca_topic_score_gemma":0.004802805,"domain_scores_codex":[0.9982656,0.0006258702,0.000122801,0.0003668323,0.0004021049,0.0002168281],"domain_scores_gemma":[0.9918282,0.005754322,0.0009233888,0.0005198026,0.0007509647,0.0002233272],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007956236,0.0007996667,0.09416442,0.0004855164,0.0003810976,0.00134563,0.0003612588,0.7832174,0.002299813,0.004594165,0.006783982,0.1047713],"study_design_scores_gemma":[0.0000115171,0.00006406829,0.01271539,0.00001612171,0.00002451151,0.0001237891,0.0001660815,0.9819812,0.0008962736,0.003480325,0.00050808,0.00001261294],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.839963,0.001355828,0.151788,0.001855898,0.0002556935,0.0001823112,0.002354628,0.000498243,0.001746352],"genre_scores_gemma":[0.9656759,0.0002585066,0.03142334,0.0000961214,0.0001113012,0.0000932147,0.00182038,0.00002439837,0.0004968157],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007082934,"threshold_uncertainty_score":0.02581221,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4113565419835101,"score_gpt":0.4777785203359856,"score_spread":0.06642197835247554,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}