{"id":"W1995864101","doi":"10.1002/prot.10150","title":"Simple sequences are rare in the Protein Data Bank","year":2002,"lang":"en","type":"article","venue":"Proteins Structure Function and Bioinformatics","topic":"Protein Structure and Dynamics","field":"Biochemistry, Genetics and Molecular Biology","cited_by":98,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Protein Data Bank (RCSB PDB); Protein Data Bank; Simple (philosophy); Sequence (biology); Sequence database; Biology; Protein sequencing; Computational biology; Sequence alignment; Protein structure database; Peptide sequence; Protein structure; Bioinformatics; Genetics; Biochemistry; Gene","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003092868,0.001037738,0.001977876,0.004335043,0.001268403,0.002654457,0.001455326,0.001476457,0.01498099],"category_scores_gemma":[0.01274993,0.0008753401,0.0006220559,0.01263428,0.0008511912,0.00320661,0.00172435,0.001420197,0.02095909],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001174619,"about_ca_system_score_gemma":0.002498265,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001311765,"about_ca_topic_score_gemma":0.002405721,"domain_scores_codex":[0.9962851,0.0005805855,0.000817381,0.0006421564,0.001471311,0.0002035602],"domain_scores_gemma":[0.9879732,0.002791888,0.003026965,0.003894408,0.001718467,0.0005950579],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"observational","study_design_scores_codex":[0.007261875,0.0008133765,0.09632204,0.009971648,0.001297956,0.006661858,0.001466862,0.00364375,0.1204977,0.04585836,0.3731323,0.3330722],"study_design_scores_gemma":[0.0003000892,0.0003843016,0.0388156,0.0006091614,0.0003638519,0.006943282,0.0003440094,0.005666846,0.02241049,0.02192735,0.90207,0.0001650432],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.246355,0.02510137,0.1147781,0.005356612,0.002600387,0.0009171465,0.4834307,0.05915377,0.06230688],"genre_scores_gemma":[0.1660587,0.008095038,0.08597057,0.002246176,0.0003280656,0.0004276239,0.7238863,0.002023913,0.01096374],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01498099,"threshold_uncertainty_score":0.05011642,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01711177448531652,"score_gpt":0.2265372435001332,"score_spread":0.2094254690148167,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}