{"id":"W4295190277","doi":"10.1101/2022.09.08.506805","title":"SPUMONI 2: Improved pangenome classification using a compressed index of minimizer digests","year":2022,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Genomics and Phylogenetic Studies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"Division of Biological Infrastructure; National Human Genome Research Institute; Directorate for Biological Sciences; Johns Hopkins University; National Institutes of Health; National Science Foundation","keywords":"Contig; Computer science; Matching (statistics); Binary number; Artificial intelligence; Pattern recognition (psychology); Metagenomics; Class (philosophy); Sequence (biology); Algorithm; Data mining; Mathematics; Genome; Statistics; Biology; Arithmetic; Genetics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001210998,0.001285817,0.001135375,0.001879271,0.0005377344,0.001517612,0.001342171,0.0009418987,0.002496531],"category_scores_gemma":[0.003736671,0.0005357716,0.0006879442,0.001682215,0.0003125398,0.00153236,0.001299802,0.0009409375,0.000950504],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007649029,"about_ca_system_score_gemma":0.001124764,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00339047,"about_ca_topic_score_gemma":0.00755491,"domain_scores_codex":[0.999324,0.000100666,0.00005129107,0.0001974015,0.0002545276,0.00007211766],"domain_scores_gemma":[0.9988959,0.0003255469,0.0001116998,0.0002861471,0.0002812362,0.00009944075],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.002052977,0.0004661907,0.01524541,0.0004690182,0.0002540626,0.0004420326,0.0003303731,0.06146627,0.305873,0.004397862,0.01724548,0.5917573],"study_design_scores_gemma":[0.00008612138,0.0001889147,0.004602096,0.00001350319,0.00002629837,0.0001860426,0.0000881753,0.9068049,0.07985876,0.002161771,0.005924255,0.00005909498],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.334399,0.0005889949,0.6341231,0.000456839,0.0002181015,0.0002539587,0.002637769,0.02407667,0.003245573],"genre_scores_gemma":[0.3068798,0.0001540665,0.6785316,0.0002123411,0.00009245124,0.0002177387,0.00790474,0.001071846,0.004935506],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00339047,"threshold_uncertainty_score":0.008351743,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02383530049851303,"score_gpt":0.2386454980095692,"score_spread":0.2148101975110561,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}