{"id":"W2921197949","doi":"10.1001/jamanetworkopen.2019.0442","title":"Comparison of Artificial Intelligence Techniques to Evaluate Performance of a Classifier for Automatic Grading of Prostate Cancer From Digitized Histopathologic Images","year":2019,"lang":"en","type":"article","venue":"JAMA Network Open","topic":"AI in cancer detection","field":"Computer Science","cited_by":111,"is_retracted":false,"has_abstract":true,"ca_institutions":"Richmond Hospital; Vancouver Coastal Health; Simon Fraser University; BC Cancer Agency; Vancouver General Hospital; University of British Columbia","funders":"","keywords":"McNemar's test; Artificial intelligence; Prostatectomy; Prostate cancer; Classifier (UML); Convolutional neural network; Grading (engineering); Computer science; Medicine; Pattern recognition (psychology); Machine learning; Cancer; Mathematics; Statistics; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01743864,0.001329561,0.0007779085,0.003495065,0.0004354297,0.001091953,0.0008357454,0.001495699,0.0004535323],"category_scores_gemma":[0.03911173,0.0003081259,0.001277545,0.001359545,0.0006342469,0.001015276,0.0007071974,0.001009092,0.0002240196],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001058538,"about_ca_system_score_gemma":0.0006174631,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002375369,"about_ca_topic_score_gemma":0.002139181,"domain_scores_codex":[0.9910393,0.004010787,0.001238534,0.00105279,0.002389091,0.0002694733],"domain_scores_gemma":[0.9531508,0.03316236,0.003342034,0.002187312,0.007739917,0.0004175639],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01122823,0.002438881,0.3375852,0.0009851817,0.006451196,0.0001967862,0.000610388,0.2175316,0.02369504,0.0006822722,0.003267225,0.395328],"study_design_scores_gemma":[0.0004116648,0.01053576,0.2244043,0.0001998007,0.001058427,0.0005172998,0.0003178273,0.7336121,0.02623676,0.001163601,0.001372385,0.0001700686],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9160978,0.003593626,0.07574674,0.0002679956,0.0002068379,0.000404034,0.0005633387,0.0005460649,0.002573648],"genre_scores_gemma":[0.9622099,0.0004913702,0.03532791,0.0001414831,0.00007300612,0.0002643062,0.0009493853,0.00006511456,0.0004775605],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01743864,"threshold_uncertainty_score":0.09222549,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0690392427908858,"score_gpt":0.3695125131974473,"score_spread":0.3004732704065615,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}