{"id":"W4400748060","doi":"10.1016/j.modpat.2024.100563","title":"Evaluation of Artificial Intelligence-Based Gleason Grading Algorithms “in the Wild”","year":2024,"lang":"en","type":"article","venue":"Modern Pathology","topic":"AI in cancer detection","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"Princess Margaret Cancer Centre","funders":"Radboud Universitair Medisch Centrum; Health~Holland","keywords":"Grading (engineering); Computer science; Pathology; Algorithm; Artificial intelligence; Medical physics; Medicine; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01177867,0.002153313,0.00128382,0.003127348,0.001150959,0.002599784,0.003121091,0.002933728,0.002338521],"category_scores_gemma":[0.02676177,0.0004211208,0.0013261,0.001885497,0.001248014,0.001950996,0.001696236,0.001725545,0.0014831],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002943196,"about_ca_system_score_gemma":0.002249792,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01622565,"about_ca_topic_score_gemma":0.01660882,"domain_scores_codex":[0.9907782,0.003086756,0.0007742411,0.00183725,0.002850487,0.0006730547],"domain_scores_gemma":[0.9843869,0.007305995,0.0009560627,0.002313779,0.004327408,0.0007099345],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.004557888,0.003200016,0.05355608,0.002659077,0.00206201,0.0005590817,0.0005068799,0.2500476,0.01382523,0.005162072,0.06466433,0.5991997],"study_design_scores_gemma":[0.000549964,0.002005148,0.02673459,0.0002716909,0.0003618271,0.0005348536,0.0004675512,0.9238144,0.0214611,0.005320307,0.01834828,0.0001302253],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8761353,0.01583738,0.05779259,0.003201131,0.002122155,0.0009519799,0.006758926,0.01168515,0.02551534],"genre_scores_gemma":[0.8945343,0.001109813,0.07925315,0.0009540364,0.0003607032,0.0002445332,0.01893744,0.0005033245,0.004102606],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01622565,"threshold_uncertainty_score":0.06229228,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09863510812397899,"score_gpt":0.341038808473111,"score_spread":0.242403700349132,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}