{"id":"W6921140991","doi":"10.6084/m9.figshare.27800394.v2","title":"A Comprehensive Surface Water Quality Monitoring Dataset (1940-2023): 2.82Million Record Resource for Empirical and ML-Based Research","year":2025,"lang":"en","type":"dataset","venue":"Figshare","topic":"","field":"","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Outlier; Water quality; Index (typography); Missing data; Quality (philosophy); Resource (disambiguation); Sample (material); Data quality; Data collection","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001032356,0.001050379,0.001054188,0.00300646,0.0003487346,0.001240309,0.001553874,0.001092706,0.04538872],"category_scores_gemma":[0.005000439,0.0004470349,0.000999794,0.01221886,0.0001882743,0.001135309,0.00143067,0.001048898,0.04632172],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001192132,"about_ca_system_score_gemma":0.002598606,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.06314503,"about_ca_topic_score_gemma":0.04481121,"domain_scores_codex":[0.9987733,0.000164607,0.0002692617,0.0003387842,0.0003250407,0.000128997],"domain_scores_gemma":[0.9965665,0.0004989089,0.0005151573,0.0004855596,0.001753052,0.0001808402],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00004512907,0.00002367321,0.004504475,0.0007074262,0.00008382066,0.00002341564,0.00002058338,0.0008848918,0.0001747404,0.000513685,0.9847907,0.00822739],"study_design_scores_gemma":[0.0002026032,0.00002479764,0.0367593,0.0005139301,0.00007694404,0.00003980233,0.0001929321,0.002203091,0.0005826544,0.001316439,0.958032,0.00005554114],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.0002398548,0.00005041913,0.0001350074,0.00006535706,0.00002075207,0.00000668508,0.9988581,0.0001401413,0.0004836663],"genre_scores_gemma":[0.001364593,0.0001041585,0.000523387,0.0000456583,0.00001290561,0.00007958629,0.9971704,0.00004720169,0.0006521342],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.06314503,"threshold_uncertainty_score":0.1518404,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5001938191741394,"score_gpt":0.5108734306667351,"score_spread":0.01067961149259566,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}