{"id":"W4382318018","doi":"10.1609/aaai.v37i12.26682","title":"Bugs in the Data: How ImageNet Misrepresents Biodiversity","year":2023,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":29,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Goddard Space Flight Center; Canadian Institute for Advanced Research","keywords":"Benchmarking; Computer science; Artificial intelligence; Set (abstract data type); Machine learning; Image (mathematics); Biodiversity; Wildlife; Object (grammar); Pattern recognition (psychology); Ecology; Biology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0006661927,0.0001313861,0.000124964,0.00004478816,0.0001918303,0.000151474,0.002308647,0.00005371971,0.003674808],"category_scores_gemma":[0.0003405742,0.00008450022,0.00005200934,0.00101212,0.0004715913,0.000285686,0.001039396,0.0001848309,0.002132155],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008159989,"about_ca_system_score_gemma":0.0000102708,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003270101,"about_ca_topic_score_gemma":0.0002120751,"domain_scores_codex":[0.9985438,0.00002115475,0.0001965709,0.0003939381,0.000540355,0.0003042033],"domain_scores_gemma":[0.9993327,0.00005783219,0.0001388246,0.0003793596,0.00004606543,0.00004525633],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"observational","study_design_scores_codex":[0.0003325151,0.001040422,0.2232569,0.0001008052,0.00004227753,0.00001434379,0.009928067,0.00008565075,0.1660907,0.1043962,0.4529074,0.04180478],"study_design_scores_gemma":[0.0002277299,0.0002978582,0.4628535,0.0001652228,0.00007425889,0.00001361756,0.09612759,0.01519746,0.357531,0.03779625,0.02865828,0.001057207],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9554279,0.000004962851,0.00001286138,0.01832872,0.0001871036,0.0003397994,0.0001488146,0.00004438627,0.02550548],"genre_scores_gemma":[0.9991875,0.00008466096,0.00001269929,0.0003194529,0.00001971395,0.00001120731,0.00001902009,0.000003777927,0.0003419742],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4242491,"threshold_uncertainty_score":0.9986448,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2291688641169977,"score_gpt":0.3201386821196012,"score_spread":0.09096981800260354,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}