{"id":"W4416593549","doi":"10.1029/2024wr039656","title":"A Comprehensive Framework for Integrating Diverse Model Performance Metrics in Calibration","year":2025,"lang":"en","type":"article","venue":"Water Resources Research","topic":"Hydrology and Watershed Management Studies","field":"Environmental Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba","funders":"University of Manitoba","keywords":"Calibration; Principal component analysis; Cluster analysis; Set (abstract data type); Residual; Range (aeronautics); Scalability; Watershed; Binary number","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01067577,0.002101563,0.0008774741,0.003030102,0.0007079334,0.002011322,0.001374374,0.001006586,0.0009567067],"category_scores_gemma":[0.01686237,0.0006806627,0.001002169,0.001922303,0.001298444,0.002256206,0.002906011,0.001836407,0.0002384742],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001269656,"about_ca_system_score_gemma":0.004354519,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005697417,"about_ca_topic_score_gemma":0.005795659,"domain_scores_codex":[0.9956878,0.001948585,0.0002549113,0.0004388176,0.001507768,0.0001620278],"domain_scores_gemma":[0.994877,0.001955091,0.0007205813,0.0006649783,0.001646009,0.0001362543],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00003345442,0.0001420522,0.002449117,0.0001210143,0.0001428178,0.00004409415,0.00009335088,0.8523114,0.005005534,0.02801598,0.0009490047,0.1106922],"study_design_scores_gemma":[0.000006897658,0.00004786736,0.0007162406,0.00003230484,0.00002061528,0.00001795116,0.00002222696,0.9858817,0.002150525,0.009997918,0.001080951,0.00002478992],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007297562,0.0001106218,0.9908183,0.0001259164,0.00001073944,0.00007421804,0.00005367283,0.0003623654,0.001146686],"genre_scores_gemma":[0.3403688,0.0002520108,0.6578103,0.0001060429,0.00003999375,0.0003437425,0.0003167372,0.000200221,0.0005620874],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01067577,"threshold_uncertainty_score":0.05645955,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0693097726068783,"score_gpt":0.344104192871555,"score_spread":0.2747944202646767,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}