{"id":"W4401214408","doi":"10.1186/s12859-024-05861-z","title":"Hybrid fragment-SMILES tokenization for ADMET prediction in drug discovery","year":2024,"lang":"en","type":"article","venue":"BMC Bioinformatics","topic":"Computational Drug Discovery Methods","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"National Research Council Canada; Brock University","funders":"National Research Council Canada; Natural Sciences and Engineering Research Council of Canada; Canada Foundation for Innovation","keywords":"Lexical analysis; Computer science; In silico; Drug discovery; Computational biology; Transformer; Artificial intelligence; Machine learning; Bioinformatics; Biology; Genetics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00148932,0.0007125926,0.0008688031,0.0007192776,0.0002925466,0.0005686236,0.001675643,0.0005429762,0.002527582],"category_scores_gemma":[0.004074098,0.0002770387,0.0006463985,0.0007237155,0.0005265212,0.001429986,0.0009200685,0.001004315,0.0009551966],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000937684,"about_ca_system_score_gemma":0.001519005,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003614356,"about_ca_topic_score_gemma":0.006242185,"domain_scores_codex":[0.9995587,0.0001608493,0.00003359443,0.00008963924,0.000101152,0.00005600378],"domain_scores_gemma":[0.9983672,0.001035312,0.0001506811,0.0001879609,0.0001907145,0.00006812994],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00182726,0.0002386885,0.004970611,0.0002979944,0.0001268082,0.0002372104,0.0001028094,0.7007089,0.01480643,0.01149815,0.003301789,0.2618833],"study_design_scores_gemma":[0.00001536663,0.0001006026,0.0001400317,0.000005299515,0.00001380131,0.00003254632,0.000008360485,0.9907869,0.006007268,0.002375024,0.0005082788,0.000006538032],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08912529,0.0006279658,0.9013015,0.0002997418,0.00006170332,0.0001212533,0.0007247642,0.006168356,0.00156936],"genre_scores_gemma":[0.821489,0.0003545718,0.1731578,0.0002383899,0.00004901714,0.0001735919,0.00175401,0.0002857661,0.002497756],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003614356,"threshold_uncertainty_score":0.008455634,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01916693910531592,"score_gpt":0.2797357114306657,"score_spread":0.2605687723253498,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}