{"id":"W3201230416","doi":"10.1101/2021.09.13.460161","title":"Embracing imperfection: machine-assisted invertebrate classification in real-world datasets","year":2021,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"Division of Environmental Biology; Natural Sciences and Engineering Research Council of Canada; National Science Foundation","keywords":"Metadata; Artificial intelligence; Machine learning; Computer science; Invertebrate; Gradient boosting; Taxonomic rank; Boosting (machine learning); Taxon; Random forest; Ecology; Biology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01499651,0.001758873,0.001170786,0.002661985,0.001316507,0.002696238,0.003672249,0.002632003,0.000827322],"category_scores_gemma":[0.03787842,0.0006823738,0.001423411,0.001718393,0.002125666,0.003682662,0.002925309,0.003214315,0.001079552],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001311829,"about_ca_system_score_gemma":0.001265072,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008372932,"about_ca_topic_score_gemma":0.009459892,"domain_scores_codex":[0.9923827,0.003122874,0.0006403574,0.002174377,0.001262784,0.0004169194],"domain_scores_gemma":[0.9791679,0.01105511,0.001576007,0.005163706,0.002587168,0.0004500756],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000778193,0.0008250703,0.2461654,0.0006743121,0.0009109896,0.0007412788,0.0007279259,0.45943,0.00663594,0.003394465,0.0293169,0.2503995],"study_design_scores_gemma":[0.00002732349,0.0001179377,0.01389112,0.00008249302,0.00004617723,0.000149488,0.0002030872,0.9722002,0.003335058,0.006129879,0.003776711,0.00004061632],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.7239685,0.002892612,0.2476733,0.003524607,0.0006685474,0.0003630042,0.005725652,0.01058431,0.004599537],"genre_scores_gemma":[0.8916924,0.0002013081,0.0967913,0.000875235,0.0001438242,0.0001597818,0.009190001,0.0002092271,0.0007368327],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.01499651,"threshold_uncertainty_score":0.07931012,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03394154248724503,"score_gpt":0.2549533147958367,"score_spread":0.2210117723085916,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}