{"id":"W4405281526","doi":"10.1002/path.6373","title":"Stress testing deep learning models for prostate cancer detection on biopsies and surgical specimens","year":2024,"lang":"en","type":"article","venue":"The Journal of Pathology","topic":"Prostate Cancer Diagnosis and Treatment","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"London Health Sciences Centre","funders":"DOD Prostate Cancer Research Program; National Institute of Biomedical Imaging and Bioengineering; DOD Peer Reviewed Cancer Research Program; National Cancer Institute; University of Texas MD Anderson Cancer Center; AstraZeneca; Helsingin Yliopisto; Varian Medical Systems; Emory University; NRG Oncology; U.S. Department of Veterans Affairs","keywords":"Convolutional neural network; Prostate cancer; Deep learning; Artificial intelligence; Prostate; Biopsy; Medicine; Cancer; Pathology; Computer science; Machine learning; Radiology; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000331239,0.00007810062,0.0001772753,0.00007086513,0.00007635503,0.00001557948,0.00002343125,0.00003439528,0.000006691393],"category_scores_gemma":[0.00004906072,0.000042336,0.00004347026,0.00006924617,0.00005672839,0.0000462961,0.00001292195,0.0002148101,8.280859e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007752047,"about_ca_system_score_gemma":0.00003815939,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001125012,"about_ca_topic_score_gemma":0.00001415465,"domain_scores_codex":[0.9994662,0.00005811244,0.0001773207,0.00008623639,0.00008061098,0.0001314769],"domain_scores_gemma":[0.9992986,0.0004263006,0.00008977548,0.00004607553,0.00009379313,0.00004547668],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002590662,0.0002145166,0.01317268,0.0004395882,0.0004309745,0.003960189,0.006626385,0.02720634,0.02065981,0.0003888487,0.0001025518,0.9242074],"study_design_scores_gemma":[0.0259683,0.07040304,0.1344985,0.01108501,0.006888893,0.06788635,0.008420709,0.3272234,0.3004404,0.02297973,0.02294273,0.00126302],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9856185,0.0117655,0.0005439766,0.001489877,0.0002480457,0.0002028337,0.00001092734,0.00001427318,0.0001060717],"genre_scores_gemma":[0.9949282,0.004364267,0.0002093336,0.00004822341,0.0003202541,0.00002001018,0.000001031251,0.00001324891,0.00009545085],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9229444,"threshold_uncertainty_score":0.1726412,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04658041728227186,"score_gpt":0.3153638255836194,"score_spread":0.2687834083013476,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}