{"id":"W4416228039","doi":"10.1101/2025.11.07.687302","title":"Learning the Unseen: Data-Augmented Deep Learning for PTM Discovery with Prosit-PTM","year":2025,"lang":"","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"vaccines and immunoinformatics approaches","field":"Biochemistry, Genetics and Molecular Biology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Thermo Fisher Scientific (Canada)","funders":"Horizon 2020 Framework Programme; Elitenetzwerk Bayern; European Commission","keywords":"Deep learning; Identification (biology); Property (philosophy); Human proteome project; Feature (linguistics); Encoding (memory); Interpretation (philosophy); Proteome","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001547689,0.001521599,0.0009415281,0.0006904951,0.0004904154,0.001177281,0.002226992,0.001844243,0.003041355],"category_scores_gemma":[0.003370825,0.0006249344,0.001054864,0.0007019186,0.000916452,0.001484949,0.001695696,0.003149184,0.001069662],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001214737,"about_ca_system_score_gemma":0.001587882,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005089674,"about_ca_topic_score_gemma":0.008001015,"domain_scores_codex":[0.9994779,0.0001511434,0.00002254377,0.0001907947,0.00009626248,0.00006132398],"domain_scores_gemma":[0.9990256,0.0004980804,0.00007723272,0.0001953322,0.0001350768,0.00006863962],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005867874,0.0004452686,0.003139701,0.0003046696,0.0002791836,0.0002164246,0.00007339779,0.7810906,0.00879374,0.006658605,0.01542379,0.1829879],"study_design_scores_gemma":[0.000009289686,0.00002553659,0.00006202389,0.000005256773,0.000006337928,0.000007856247,0.000003733281,0.9953657,0.001352277,0.002760162,0.0003973225,0.000004431534],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1280311,0.002667671,0.8361175,0.001567325,0.000290565,0.0001397537,0.003051845,0.02392947,0.004204776],"genre_scores_gemma":[0.6894987,0.0005254679,0.2938149,0.001150648,0.0001233724,0.0002646099,0.008696684,0.0008795006,0.005046198],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005089674,"threshold_uncertainty_score":0.01017433,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01376455659092892,"score_gpt":0.2232471392514917,"score_spread":0.2094825826605628,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}