{"id":"W4378214151","doi":"10.1029/2022wr033918","title":"In Defense of Metrics: Metrics Sufficiently Encode Typical Human Preferences Regarding Hydrological Model Performance","year":2023,"lang":"en","type":"article","venue":"Water Resources Research","topic":"Hydrology and Watershed Management Studies","field":"Environmental Science","cited_by":57,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Horizon 2020 Framework Programme; Österreichische Forschungsförderungsgesellschaft; Bundesministerium für Bildung, Wissenschaft und Forschung; Austrian Science Fund; European Commission; Nvidia","keywords":"Benchmarking; Computer science; ENCODE; Variety (cybernetics); Suite; Set (abstract data type); Data science; Metric (unit); Machine learning; Artificial intelligence; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003794107,0.0001502558,0.0002769342,0.001018106,0.0004033825,0.00003322489,0.0006925118,0.000141317,0.0003456098],"category_scores_gemma":[0.0002105739,0.00009761691,0.00005990124,0.002217528,0.0007970358,0.0001861276,0.00180326,0.0004938946,0.0007740777],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00010403,"about_ca_system_score_gemma":0.000003349467,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000195131,"about_ca_topic_score_gemma":0.00006868598,"domain_scores_codex":[0.9968218,0.0003506226,0.0003613396,0.0005210473,0.001001335,0.0009438096],"domain_scores_gemma":[0.9993181,0.0002100998,0.00003764817,0.0003191055,0.00002522546,0.00008984057],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003369987,0.0003165454,0.7913972,0.0001055611,0.00004867147,0.00008627117,0.01204804,0.1851066,0.005722608,0.0003255928,0.003595541,0.0009104316],"study_design_scores_gemma":[0.002271979,0.001914514,0.1669549,0.00008276127,0.00004832767,0.000007246851,0.002039864,0.7467834,0.03032663,0.02079105,0.02782853,0.0009508609],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.973209,0.00003105323,0.00003105835,0.0004314819,0.00002868191,0.0002473379,0.000002512487,0.00004963048,0.02596925],"genre_scores_gemma":[0.9960643,0.000133852,0.0001102077,0.00004593498,0.00001980458,0.0000528495,0.000006932508,0.00001198248,0.00355412],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.6244423,"threshold_uncertainty_score":0.9949461,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1030342086215556,"score_gpt":0.3333135966286256,"score_spread":0.23027938800707,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}