{"id":"W4377028399","doi":"10.1061/9780784484852.085","title":"Impact of Data Preparation on the Performance of Pipe Break Status Prediction Models","year":2023,"lang":"en","type":"article","venue":"","topic":"Water Systems and Optimization","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Undersampling; Sampling (signal processing); Statistics; Logistic regression; Random forest; Decision tree; Computer science; Engineering; Environmental science; Data mining; Machine learning; Mathematics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02044838,0.00157756,0.001180653,0.001108345,0.0009790694,0.001874907,0.001168207,0.001420551,0.0005398724],"category_scores_gemma":[0.05142063,0.0005865149,0.002025397,0.001241621,0.0009508839,0.002461524,0.001533468,0.002551587,0.0003163606],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001255039,"about_ca_system_score_gemma":0.002047491,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01750897,"about_ca_topic_score_gemma":0.009913384,"domain_scores_codex":[0.9908183,0.004333491,0.001227829,0.001742668,0.001338722,0.0005391468],"domain_scores_gemma":[0.9557941,0.03412716,0.002301472,0.003409914,0.003597645,0.0007697718],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003909258,0.001258512,0.2013199,0.0004535279,0.0009535394,0.0006332131,0.0007255696,0.6401539,0.008146125,0.0008455517,0.00274494,0.1388559],"study_design_scores_gemma":[0.0001839287,0.002047831,0.07211677,0.0001897479,0.0003270791,0.0002316069,0.001199911,0.9007306,0.01815267,0.001618028,0.003070974,0.0001309141],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9720324,0.001080298,0.02257823,0.0008984865,0.0001980224,0.0001948691,0.001117069,0.0007698613,0.001130884],"genre_scores_gemma":[0.9805167,0.0001930664,0.01553464,0.0001741746,0.0000261289,0.0001049165,0.002959925,0.0000650673,0.0004253018],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02044838,"threshold_uncertainty_score":0.1081426,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04083835750851412,"score_gpt":0.2603414429169294,"score_spread":0.2195030854084153,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}