{"id":"W4377028399","doi":"10.1061/9780784484852.085","title":"Impact of Data Preparation on the Performance of Pipe Break Status Prediction Models","year":2023,"lang":"en","type":"article","venue":"","topic":"Water Systems and Optimization","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"","keywords":"Undersampling; Sampling (signal processing); Statistics; Logistic regression; Random forest; Decision tree; Computer science; Engineering; Environmental science; Data mining; Machine learning; Mathematics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001205228,0.00004523637,0.000060784,0.00004464633,0.0000143982,0.000006671469,0.00008325121,0.0000236105,0.00001463797],"category_scores_gemma":[0.000003481397,0.00002749064,0.00001890432,0.0001520379,0.000005726044,0.0003327251,0.00001564181,0.00002434955,0.000006496219],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001771672,"about_ca_system_score_gemma":0.00001151504,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001156647,"about_ca_topic_score_gemma":0.00001754694,"domain_scores_codex":[0.999614,0.000009075905,0.0001478875,0.00006208017,0.00009288648,0.00007406403],"domain_scores_gemma":[0.9996177,0.00001598162,0.00002606586,0.000300744,0.00002738932,0.0000121017],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000009468724,0.000004823069,0.0008609959,0.00003061945,0.00002242778,1.929932e-8,0.0002759404,0.9916055,0.00117164,0.00005438706,0.005810349,0.0001538292],"study_design_scores_gemma":[0.00006478695,0.0000847898,0.008327796,0.00002058055,0.000004730332,2.507507e-7,0.00001977045,0.9871784,0.004232419,0.000009749946,0.00003182384,0.00002485195],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.972767,0.00001116951,0.02140964,0.000005412416,0.00008536143,0.0001532863,0.0001187251,0.0001208239,0.00532858],"genre_scores_gemma":[0.99935,0.00005886567,0.00009298267,7.444743e-7,0.00002112554,0.000004801269,0.0001809221,0.000007719519,0.0002828864],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02658295,"threshold_uncertainty_score":0.1121036,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04083835750851412,"score_gpt":0.2603414429169294,"score_spread":0.2195030854084153,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}