{"id":"W4404407658","doi":"10.1101/2024.11.13.623458","title":"Language model-guided anticipation and discovery of unknown metabolites","year":2024,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Metabolomics and Mass Spectrometry Studies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; University of Toronto; University of Alberta","funders":"","keywords":"Metabolome; Metabolomics; Computational biology; Metabolite; Anticipation (artificial intelligence); Biomarker discovery; Chemical space; Biology; Computer science; Proteomics; Drug discovery; Bioinformatics; Biochemistry; Artificial intelligence; Gene","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009490612,0.0008807507,0.0009198753,0.0009224491,0.0003349878,0.0009955652,0.0009164155,0.0009528388,0.001580001],"category_scores_gemma":[0.00356181,0.0004502617,0.001059857,0.0005620852,0.0008344484,0.001723057,0.001563553,0.001747533,0.0004837624],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001053263,"about_ca_system_score_gemma":0.001718251,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002100856,"about_ca_topic_score_gemma":0.003288288,"domain_scores_codex":[0.99962,0.0001212212,0.00001722141,0.000111036,0.00006804564,0.00006238541],"domain_scores_gemma":[0.9977952,0.001630385,0.0001734597,0.0001266135,0.0001632659,0.0001110851],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001093691,0.0003113921,0.007938442,0.0004315691,0.0001681515,0.000922227,0.0002621014,0.6424742,0.05751226,0.05863556,0.006821553,0.2234289],"study_design_scores_gemma":[0.00001286692,0.00002638543,0.0001084068,0.00000510188,0.000008818411,0.00003320149,0.0000129133,0.9746159,0.003771858,0.02091476,0.0004832047,0.00000646104],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1560236,0.0008092352,0.833715,0.002897947,0.00009415898,0.00005818203,0.001045731,0.002673774,0.00268239],"genre_scores_gemma":[0.7480829,0.0005965616,0.2440462,0.0008859476,0.0001201461,0.0001205687,0.002264586,0.0002191979,0.003663865],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.002100856,"threshold_uncertainty_score":0.007641971,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01310699261375044,"score_gpt":0.2487384986334436,"score_spread":0.2356315060196932,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}