{"id":"W4408609803","doi":"10.1101/2025.03.17.643654","title":"Leveraging synthetic data produced from museum specimens to train adaptable species classification models","year":2025,"lang":"en","type":"preprint","venue":"bioRxiv (Cold Spring Harbor Laboratory)","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Laurentian University; Canadian Museum of Nature; University of British Columbia","funders":"","keywords":"Computer science; Data science; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001206158,0.000748976,0.0003243777,0.0008287663,0.0002558183,0.0006552472,0.001061109,0.0007830544,0.00180094],"category_scores_gemma":[0.003313937,0.0004337454,0.0009077693,0.0005539582,0.0005467745,0.0006363513,0.0007918427,0.000865689,0.00065748],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005740856,"about_ca_system_score_gemma":0.0004932212,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00459198,"about_ca_topic_score_gemma":0.005391974,"domain_scores_codex":[0.9996799,0.00008474403,0.00001739351,0.0001177423,0.00007125363,0.00002899044],"domain_scores_gemma":[0.9986237,0.0005764655,0.00009690304,0.0003592777,0.0002858269,0.00005785363],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001409659,0.000144343,0.01102537,0.0002136994,0.0001306281,0.0002263625,0.0001583104,0.7802348,0.04622552,0.001678665,0.005767023,0.1540543],"study_design_scores_gemma":[0.000007450547,0.0000351099,0.001886499,0.00001259005,0.000009305645,0.00005319258,0.00003856837,0.9832797,0.01176054,0.001115004,0.001787647,0.00001434857],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.46544,0.0003957039,0.5180892,0.0005678568,0.0002382306,0.0002670917,0.002375526,0.008758189,0.003868101],"genre_scores_gemma":[0.7170768,0.0001717515,0.2751182,0.0001916997,0.00003114398,0.0002232811,0.00514414,0.0004995505,0.001543416],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00459198,"threshold_uncertainty_score":0.009130478,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09429795137017015,"score_gpt":0.2501992269836535,"score_spread":0.1559012756134834,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}