{"id":"W4403764051","doi":"10.3390/data9110122","title":"Towards a Taxonomy Machine: A Training Set of 5.6 Million Arthropod Images","year":2024,"lang":"en","type":"article","venue":"Data","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Guelph","funders":"Ministry of Colleges and Universities; Canada First Research Excellence Fund; Ministero dello Sviluppo Economico; Ontario Ministry of Economic Development, Job Creation and Trade; Guanacaste Dry Forest Conservation Fund; Genome Canada; Ontario Genomics; Forest Conservation Fund; Polar Knowledge Canada","keywords":"Taxonomy (biology); Arthropod; Artificial intelligence; Set (abstract data type); Training set; Computer science; Natural language processing; Ecology; Biology; Programming language","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001756385,0.001214617,0.001000702,0.002381155,0.0008947107,0.001597489,0.001956862,0.001982462,0.005642072],"category_scores_gemma":[0.005124665,0.0008086479,0.00142039,0.002152817,0.0005879853,0.002311315,0.001688231,0.001537389,0.007132121],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001051029,"about_ca_system_score_gemma":0.001126636,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006850801,"about_ca_topic_score_gemma":0.008657816,"domain_scores_codex":[0.9990219,0.0001338875,0.00008635924,0.0003638515,0.0002853443,0.0001086956],"domain_scores_gemma":[0.9985995,0.0002680231,0.00009827321,0.0004566452,0.0004735574,0.0001039576],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0006970345,0.001088546,0.03649412,0.001352932,0.0005112072,0.0004760192,0.0003533593,0.02304775,0.0340985,0.002125532,0.2257557,0.6739992],"study_design_scores_gemma":[0.0003134811,0.001306812,0.172389,0.0008889482,0.0005059703,0.002540148,0.001457501,0.5258794,0.05521848,0.01346613,0.2258015,0.0002326949],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"dataset","genre_scores_codex":[0.5241031,0.008564197,0.1572009,0.003864722,0.001930595,0.001788239,0.254179,0.029272,0.01909718],"genre_scores_gemma":[0.2892093,0.001492275,0.3512977,0.0007818443,0.0002917624,0.0009329818,0.3490155,0.0005274148,0.006451119],"genre_candidate":"dataset","genre_consensus":null,"teacher_disagreement_score":0.006850801,"threshold_uncertainty_score":0.01887465,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1436977197374064,"score_gpt":0.3139530033199601,"score_spread":0.1702552835825537,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}