{"id":"W4401399881","doi":"10.1142/9789811267048_0026","title":"On Removing Diverse Data for Training Machine Learning Models","year":2024,"lang":"en","type":"book-chapter","venue":"Series on computers and operations research","topic":"Machine Learning and Algorithms","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal; Concordia University; Group for Research in Decision Analysis","funders":"","keywords":"Training (meteorology); Computer science; Machine learning; Artificial intelligence; Training set; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005392991,0.002118214,0.002080414,0.001632623,0.001278986,0.001445685,0.003706973,0.002792954,0.005824343],"category_scores_gemma":[0.01940824,0.001173082,0.002053694,0.002695187,0.001838008,0.00369011,0.003905005,0.006403572,0.003297445],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005510453,"about_ca_system_score_gemma":0.0008180641,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003141169,"about_ca_topic_score_gemma":0.006645326,"domain_scores_codex":[0.9966784,0.00163619,0.0002121329,0.0003928192,0.0009413488,0.0001391963],"domain_scores_gemma":[0.9899984,0.007263696,0.0001717845,0.001689014,0.0007594225,0.0001175847],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000243475,0.0002246718,0.001056765,0.0002978097,0.0002062281,0.000206234,0.0001754981,0.199161,0.003822177,0.030344,0.03445923,0.7298028],"study_design_scores_gemma":[0.00004444643,0.00006868503,0.0006252819,0.00009066665,0.00006908582,0.0001267687,0.00005553621,0.8968424,0.003581487,0.0901424,0.008325775,0.00002755846],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.004176078,0.001247337,0.9900255,0.0005034927,0.0002857382,0.00007330294,0.0002527192,0.0007366802,0.002699182],"genre_scores_gemma":[0.07624809,0.001983576,0.901576,0.001409007,0.0008782095,0.0004458893,0.003876234,0.0009228843,0.01266011],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005824343,"threshold_uncertainty_score":0.02852124,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2136281158318142,"score_gpt":0.3666885289686321,"score_spread":0.1530604131368179,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}