{"id":"W4386305688","doi":"10.1093/bib/bbad319","title":"Sequence-based prediction model of protein crystallization propensity using machine learning and two-level feature selection","year":2023,"lang":"en","type":"article","venue":"Briefings in Bioinformatics","topic":"Machine Learning in Bioinformatics","field":"Biochemistry, Genetics and Molecular Biology","cited_by":63,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"National Science and Technology Council","keywords":"Feature selection; Pipeline (software); Protein crystallization; Computer science; Support vector machine; Hyperparameter; Dimensionality reduction; Artificial intelligence; Machine learning; Sequence (biology); Selection (genetic algorithm); Linear discriminant analysis; Feature (linguistics); Data mining; Crystallization; Engineering; Chemistry","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001136204,0.0008330125,0.001033991,0.001217464,0.0003475321,0.0006897574,0.000998441,0.0007538749,0.001033607],"category_scores_gemma":[0.001352341,0.0003754338,0.001257372,0.0008069716,0.0003460083,0.0007460876,0.000435701,0.0008273433,0.0003842489],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008439413,"about_ca_system_score_gemma":0.00128581,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009814367,"about_ca_topic_score_gemma":0.006122793,"domain_scores_codex":[0.9996146,0.00008487971,0.00002840561,0.0001212321,0.00008191484,0.00006908224],"domain_scores_gemma":[0.9993654,0.0003161989,0.00008108086,0.0000362862,0.0001696253,0.00003137079],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002094858,0.0002199875,0.00879843,0.00007817183,0.0001104366,0.0001710779,0.00004373019,0.8993415,0.005155647,0.001348911,0.001813394,0.08270916],"study_design_scores_gemma":[0.000002354204,0.000007303817,0.0002327158,6.829844e-7,0.000002710843,0.000006357006,6.588523e-7,0.9994439,0.0001471681,0.0001330433,0.00002142611,0.000001740928],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.230898,0.0008291115,0.7645699,0.000483385,0.00006793664,0.0001025227,0.0004000235,0.001667014,0.0009821377],"genre_scores_gemma":[0.9363921,0.0003763098,0.05980778,0.0001081683,0.0000527487,0.000184823,0.0006900571,0.00005515342,0.002332779],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009814367,"threshold_uncertainty_score":0.0195145,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03691560672882826,"score_gpt":0.2716449149048197,"score_spread":0.2347293081759914,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}