{"id":"W4285008006","doi":"10.1101/2022.07.11.499243","title":"CheckM2: a rapid, scalable and accurate tool for assessing microbial genome quality using machine learning","year":2022,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Genomics and Phylogenetic Studies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":119,"is_retracted":false,"has_abstract":true,"ca_institutions":"Parks Canada","funders":"Australian Government; McMaster University; National Science Foundation","keywords":"Genome; Metagenomics; Scalability; Computer science; Tree (set theory); Computational biology; Quality (philosophy); Data mining; Artificial intelligence; Machine learning; Biology; Gene; Genetics; Mathematics; Database","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003736258,0.002607255,0.00137662,0.003821086,0.0007883778,0.002075276,0.003082806,0.001898922,0.005540298],"category_scores_gemma":[0.01180623,0.001143272,0.001491426,0.001803794,0.0006070331,0.001977732,0.002682275,0.00198118,0.003291907],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008406262,"about_ca_system_score_gemma":0.001574598,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002028876,"about_ca_topic_score_gemma":0.003343487,"domain_scores_codex":[0.9972569,0.0003842592,0.0001536395,0.0006062745,0.001433607,0.0001653192],"domain_scores_gemma":[0.9946501,0.002193353,0.0009340539,0.001060924,0.00086783,0.0002937661],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002300635,0.0006370367,0.07864127,0.002445323,0.001380311,0.0007792895,0.0004057467,0.0588774,0.12401,0.007143522,0.2412531,0.4821264],"study_design_scores_gemma":[0.0002439628,0.0002974762,0.01973118,0.0001246945,0.0001198763,0.0005193459,0.00007433842,0.7950298,0.1319534,0.01074011,0.04083343,0.0003324485],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.07803262,0.001182932,0.6121954,0.0006184229,0.0004259016,0.0004036314,0.03978987,0.2630297,0.004321556],"genre_scores_gemma":[0.2699789,0.0004685356,0.6370085,0.0006027507,0.0001685161,0.0009229137,0.07325751,0.01328547,0.004306854],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005540298,"threshold_uncertainty_score":0.01975948,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02819325749494164,"score_gpt":0.2692766303489962,"score_spread":0.2410833728540545,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}