{"id":"W4321606216","doi":"10.1101/2023.02.22.529597","title":"Retrieved Sequence Augmentation for Protein Representation Learning","year":2023,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Machine Learning in Bioinformatics","field":"Biochemistry, Genetics and Molecular Biology","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Computer science; Preprocessor; Inference; Protein sequencing; Sequence (biology); Artificial intelligence; Representation (politics); Machine learning; Peptide sequence; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001206337,0.0008820422,0.0009332764,0.0007891024,0.0002198362,0.0006662221,0.001912795,0.001064969,0.003390637],"category_scores_gemma":[0.00286248,0.0003653444,0.0009547026,0.0008238397,0.0006535156,0.002203536,0.001145763,0.00164894,0.001830788],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006721206,"about_ca_system_score_gemma":0.0008348325,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001546779,"about_ca_topic_score_gemma":0.001675515,"domain_scores_codex":[0.9995291,0.0001567558,0.00002439148,0.0001541342,0.00009109203,0.00004449788],"domain_scores_gemma":[0.9986988,0.0006293879,0.0001433346,0.0002520639,0.000213872,0.00006248689],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007236433,0.0005138716,0.001836893,0.0003210986,0.00009678769,0.0002328475,0.00008368149,0.5540829,0.03415957,0.01597201,0.010355,0.3816217],"study_design_scores_gemma":[0.000006822509,0.0000352018,0.00004671097,0.000004216258,0.000004898936,0.00001826364,0.000002458566,0.9936966,0.002371438,0.00323327,0.0005767719,0.000003381138],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05916421,0.001160047,0.9290451,0.0007543766,0.0001495954,0.0001120617,0.0005869102,0.005960265,0.00306753],"genre_scores_gemma":[0.6700643,0.0009393169,0.3162237,0.0007045015,0.0003051639,0.0003430818,0.002452245,0.0004629478,0.008504883],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003390637,"threshold_uncertainty_score":0.01134282,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02938578089126726,"score_gpt":0.2844136217408884,"score_spread":0.2550278408496212,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}