{"id":"W4320086217","doi":"10.48550/arxiv.2206.01653","title":"Metrics reloaded: Recommendations for image analysis validation","year":2022,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":62,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Cancer Institute; Medical Research Council; National Institutes of Health; Masarykova Univerzita; Novo Nordisk Fonden; Universidad de Buenos Aires; University of Pennsylvania; Novo Nordisk; KU Leuven; University of Oxford; Cancer Research UK; University College London; Universitetet i Tromsø; King's College London; Oulun Yliopisto; Schweizerischer Nationalfonds zur Förderung der Wissenschaftlichen Forschung; National Institute of Neurological Disorders and Stroke; Canadian Institute for Advanced Research; Royal Academy of Engineering; Nederlandse Organisatie voor Wetenschappelijk Onderzoek; NIH Clinical Center; Agence Nationale de la Recherche; Innosuisse - Schweizerische Agentur für Innovationsförderung; Alzheimer's Society; School of Medicine, Indiana University; European Commission; Silicon Valley Community Foundation; Broad Institute; University of Bern; Sydäntutkimussäätiö; Deutsches Krebsforschungszentrum; Natural Sciences and Engineering Research Council of Canada; Consejo Nacional de Investigaciones Científicas y Técnicas; Foundation for Cardiovascular Research; McGill University; National Science Foundation","keywords":"Computer science; Process (computing); Metric (unit); Data mining; Domain (mathematical analysis); Object (grammar); Representation (politics); Task (project management); Machine learning; Artificial intelligence; Mathematics","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2617106,0.005024291,0.003436578,0.02038885,0.003652454,0.01883563,0.01222419,0.01003937,0.01027427],"category_scores_gemma":[0.592537,0.00193178,0.004469744,0.0119645,0.008734279,0.03687595,0.01422972,0.01374669,0.009189825],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.008469219,"about_ca_system_score_gemma":0.02815964,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01133417,"about_ca_topic_score_gemma":0.01079157,"domain_scores_codex":[0.7720144,0.1306814,0.034463,0.01059669,0.04811231,0.004132118],"domain_scores_gemma":[0.290494,0.3236897,0.02810718,0.06595056,0.2781877,0.01357103],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001907107,0.0004940956,0.006272458,0.005189617,0.0002022192,0.000346729,0.004639667,0.006476748,0.002480447,0.0766885,0.2967566,0.6002622],"study_design_scores_gemma":[0.0003086775,0.0004188395,0.004361744,0.02900852,0.0002659905,0.000618091,0.006537435,0.02768985,0.005398098,0.2650187,0.6595487,0.000825307],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007674848,0.030468,0.6931001,0.2207616,0.007629944,0.003242879,0.001811943,0.01572358,0.01958714],"genre_scores_gemma":[0.02763709,0.008167223,0.9368305,0.01107262,0.001288351,0.004010841,0.00333263,0.00417899,0.003481731],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.7382894,"threshold_uncertainty_score":0.9104422,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.423353253256388,"score_gpt":0.3614132285686075,"score_spread":0.06194002468778048,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}