{"id":"W2108197782","doi":"10.1016/j.jbi.2004.07.008","title":"Classification and knowledge discovery in protein databases","year":2004,"lang":"en","type":"article","venue":"Journal of Biomedical Informatics","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":93,"is_retracted":false,"has_abstract":false,"ca_institutions":"Canadian Imperial Bank of Commerce (Canada)","funders":"U.S. National Library of Medicine; National Institutes of Health; National Science Foundation","keywords":"Artificial intelligence; Computer science; Machine learning; Feature selection; Cluster analysis; Robustness (evolution); Pattern recognition (psychology); Data mining; Ensemble learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01244732,0.0006237199,0.001991842,0.006942687,0.001623338,0.005354436,0.002349548,0.001607962,0.001069883],"category_scores_gemma":[0.03606366,0.0006959006,0.001336232,0.007221388,0.001713322,0.00941187,0.002217537,0.002321245,0.0005485506],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001661566,"about_ca_system_score_gemma":0.002221102,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002386167,"about_ca_topic_score_gemma":0.002074064,"domain_scores_codex":[0.9910309,0.002850659,0.001466529,0.0009133587,0.003372943,0.000365732],"domain_scores_gemma":[0.9747406,0.01681922,0.001983473,0.003216858,0.002691934,0.0005478392],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008758104,0.001022223,0.02297474,0.001094765,0.0004063155,0.0004525206,0.0007758418,0.0489338,0.006486452,0.05513838,0.0121122,0.8497269],"study_design_scores_gemma":[0.00007283623,0.0001482363,0.006015363,0.0001510897,0.000190296,0.000541108,0.0005377266,0.7441092,0.01108024,0.2271231,0.009989551,0.000041309],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1621005,0.01449006,0.8075101,0.008454653,0.0006447158,0.0003315862,0.001869023,0.001764063,0.002835335],"genre_scores_gemma":[0.5901968,0.005670602,0.396016,0.0007799778,0.0008063014,0.0002919825,0.003654541,0.0001194948,0.002464355],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01244732,"threshold_uncertainty_score":0.06582844,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03453498297277332,"score_gpt":0.3070496474201495,"score_spread":0.2725146644473762,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}