{"id":"W4394769874","doi":"10.1093/bioinformatics/btae196","title":"Effect of tokenization on transformers for biological sequences","year":2024,"lang":"en","type":"article","venue":"Bioinformatics","topic":"Machine Learning in Bioinformatics","field":"Biochemistry, Genetics and Molecular Biology","cited_by":41,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Tel Aviv University; Azrieli Foundation; Israel Science Foundation","keywords":"Lexical analysis; Computer science; Artificial intelligence; Natural language processing; Biological network; Inference; Security token; Machine learning; Computational biology; Biology","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007213441,0.002025302,0.001128949,0.001250913,0.0008278539,0.002229631,0.002572385,0.001381748,0.004132784],"category_scores_gemma":[0.040211,0.0006181962,0.001069955,0.001180831,0.002007782,0.006910073,0.002041326,0.002950038,0.001567392],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001814889,"about_ca_system_score_gemma":0.003246874,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005715546,"about_ca_topic_score_gemma":0.006271221,"domain_scores_codex":[0.9956024,0.001466346,0.0005762365,0.001213124,0.0006042472,0.0005377011],"domain_scores_gemma":[0.95991,0.02961743,0.002054449,0.005076753,0.002384638,0.0009567727],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01167185,0.001581415,0.02437676,0.001543687,0.0005782658,0.001033283,0.0006535806,0.4199114,0.05840483,0.01563106,0.01423355,0.4503804],"study_design_scores_gemma":[0.0004175288,0.001420413,0.00218717,0.00009690608,0.0002859079,0.0003331917,0.0004349427,0.8803648,0.09612203,0.01390416,0.004353477,0.00007955692],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8267384,0.002184932,0.1438132,0.001695333,0.00113564,0.0002850427,0.001382894,0.01736746,0.005397153],"genre_scores_gemma":[0.9041687,0.000547124,0.08826085,0.0006207575,0.0001227208,0.000138785,0.002906722,0.001179102,0.002055168],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007213441,"threshold_uncertainty_score":0.03814882,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009661397653894933,"score_gpt":0.2905729843578977,"score_spread":0.2809115867040027,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}