{"id":"W4405281526","doi":"10.1002/path.6373","title":"Stress testing deep learning models for prostate cancer detection on biopsies and surgical specimens","year":2024,"lang":"en","type":"article","venue":"The Journal of Pathology","topic":"Prostate Cancer Diagnosis and Treatment","field":"Medicine","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"London Health Sciences Centre","funders":"DOD Prostate Cancer Research Program; National Institute of Biomedical Imaging and Bioengineering; DOD Peer Reviewed Cancer Research Program; National Cancer Institute; University of Texas MD Anderson Cancer Center; AstraZeneca; Helsingin Yliopisto; Varian Medical Systems; Emory University; NRG Oncology; U.S. Department of Veterans Affairs","keywords":"Convolutional neural network; Prostate cancer; Deep learning; Artificial intelligence; Prostate; Biopsy; Medicine; Cancer; Pathology; Computer science; Machine learning; Radiology; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003457223,0.001376646,0.0005787964,0.0004901016,0.0003192918,0.0005576655,0.0009137566,0.0008841197,0.001133946],"category_scores_gemma":[0.007514989,0.0004104132,0.00090502,0.0003045459,0.0006520145,0.0006503202,0.001081478,0.0009265521,0.0003878442],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001048273,"about_ca_system_score_gemma":0.0007302472,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01053099,"about_ca_topic_score_gemma":0.008686963,"domain_scores_codex":[0.9989561,0.0003058327,0.00008363713,0.0002998893,0.0002079988,0.0001464776],"domain_scores_gemma":[0.9961883,0.001917218,0.0003614999,0.0004213778,0.0008998952,0.0002117227],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"observational","study_design_scores_codex":[0.003438319,0.001486953,0.1227089,0.0003775131,0.0008550296,0.0003972441,0.0003183139,0.6353699,0.05265679,0.000675314,0.003377536,0.1783383],"study_design_scores_gemma":[0.00003563148,0.001113739,0.01739942,0.00002716437,0.00006681597,0.00006720664,0.00008668964,0.9583809,0.0221001,0.0003508514,0.0003481858,0.00002331367],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9903802,0.0002901748,0.007934915,0.0001220212,0.00009511665,0.00005022496,0.0002688519,0.0002589966,0.0005995063],"genre_scores_gemma":[0.9932553,0.00006511602,0.005064436,0.00005578121,0.00001832689,0.00003728758,0.0008685097,0.00002097667,0.0006143387],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01053099,"threshold_uncertainty_score":0.02093941,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04658041728227186,"score_gpt":0.3153638255836194,"score_spread":0.2687834083013476,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}