{"id":"W4413799866","doi":"10.20944/preprints202508.1957.v1","title":"Text Mining and Machine Learning-Based Data Extraction for Environmental Pollutants (PPDs and PPDs-Q): Machine Learning-Enabled Global Aqueous Concentration Compilation and Potential Biotic Risk Implications","year":2025,"lang":"en","type":"preprint","venue":"Preprints.org","topic":"Water Quality and Pollution Assessment","field":"Environmental Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Jinan University","keywords":"Benthic zone; Artificial intelligence; Machine learning; Environmental science; Environmental chemistry; Chemistry; Geography; Ecology; Biology; Computer science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001026259,0.0003977194,0.0003719131,0.00006071469,0.0007597067,0.0001237454,0.0003145588,0.0003085175,0.0005255808],"category_scores_gemma":[0.0001827298,0.0004314699,0.00006220001,0.000106823,0.000332034,0.0003139148,0.001677303,0.0005892155,0.0000275295],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003882004,"about_ca_system_score_gemma":0.00005766273,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000812974,"about_ca_topic_score_gemma":0.0003218883,"domain_scores_codex":[0.9968789,0.0005349144,0.0005868141,0.001338943,0.0003061003,0.0003543444],"domain_scores_gemma":[0.9983711,0.0001630759,0.0006122863,0.000647113,0.00001227067,0.0001942087],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001908937,0.0001642476,0.9436305,0.0001069166,0.00008747567,0.000001723898,0.0002958126,0.02383525,0.007178298,0.00002179828,0.0000135584,0.02447358],"study_design_scores_gemma":[0.001010526,0.00005833528,0.7340792,0.0000489492,0.0002172761,0.00001737726,0.00006612902,0.2610789,0.0007400069,0.0002414004,0.002121773,0.0003200555],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.962258,0.000381582,0.02701434,0.001320789,0.0002217367,0.001426638,0.006840306,0.000129359,0.0004072553],"genre_scores_gemma":[0.9940957,0.000731552,0.001848215,0.0001062508,0.00005259395,0.00005812593,0.00251358,0.00002042003,0.0005735582],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2372437,"threshold_uncertainty_score":0.9998137,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08713153731988729,"score_gpt":0.3439213031672546,"score_spread":0.2567897658473672,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}