{"id":"W4415283055","doi":"10.1021/acs.analchem.5c01417","title":"Practical Guidance for Training Machine Learning Models in Metabolomics and Mass Spectrometry Research","year":2025,"lang":"en","type":"article","venue":"Analytical Chemistry","topic":"Metabolomics and Mass Spectrometry Studies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"IONICS Mass Spectrometry (Canada); University of Alberta; University of British Columbia","funders":"Basic and Applied Basic Research Foundation of Guangdong Province; U.S. Forest Service; Canada Research Chairs; Genome British Columbia; Genome Canada","keywords":"Feature (linguistics); Metabolomics; Training set; Training (meteorology); Code (set theory)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.003474582,0.002866449,0.001319254,0.002129132,0.0009398149,0.002503951,0.002943717,0.002944698,0.1039821],"category_scores_gemma":[0.02751359,0.001944128,0.001086974,0.002214994,0.000560139,0.002539137,0.001956142,0.00481617,0.08014605],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009576588,"about_ca_system_score_gemma":0.002508275,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005339046,"about_ca_topic_score_gemma":0.01119968,"domain_scores_codex":[0.9978962,0.0007645288,0.0002390739,0.0002428494,0.0007668838,0.00009038758],"domain_scores_gemma":[0.9897429,0.00720036,0.0003746877,0.0005818428,0.001818646,0.0002814531],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002033223,0.0003532147,0.001018801,0.002171628,0.00006708146,0.0005105735,0.0003372738,0.03675698,0.007610104,0.02848749,0.4591746,0.4633089],"study_design_scores_gemma":[0.0003191238,0.0002400665,0.001654139,0.00173216,0.00004757977,0.00119764,0.0002517648,0.1302829,0.01178672,0.1152395,0.7370439,0.0002045993],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001647041,0.002972019,0.936552,0.002538081,0.0006434055,0.0006311704,0.009012703,0.03303996,0.01296362],"genre_scores_gemma":[0.004063582,0.002364501,0.9679337,0.000962469,0.0002105608,0.001314659,0.007324607,0.003506335,0.01231962],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9965254,"threshold_uncertainty_score":0.3478547,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08157259157126,"score_gpt":0.3760510589880692,"score_spread":0.2944784674168092,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}