{"id":"W4417346112","doi":"10.64898/2025.12.11.25342109","title":"Deceptive Bias Measurement in Deep Learning: Assessing Shortcut Reliance in TCGA Cancer Models","year":2025,"lang":"","type":"article","venue":"medRxiv","topic":"Explainable Artificial Intelligence (XAI)","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Brock University; Ontario Tech University","funders":"","keywords":"Metric (unit); Exploit; Limit (mathematics); Measure (data warehouse); Key (lock); Deep learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.005406772,0.0006526025,0.0008608676,0.001273773,0.0004156014,0.0008225507,0.002061737,0.0003506988,0.000102413],"category_scores_gemma":[0.001549979,0.0007301684,0.000186535,0.005988413,0.0002998231,0.002536989,0.0007922289,0.001586296,0.0001014282],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002398608,"about_ca_system_score_gemma":0.001568631,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003989373,"about_ca_topic_score_gemma":0.0177207,"domain_scores_codex":[0.9919332,0.001274004,0.001727617,0.00193675,0.001465374,0.001663036],"domain_scores_gemma":[0.9969503,0.0004157728,0.0004258184,0.001112773,0.0008562735,0.0002391105],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005889949,0.000436769,0.2948608,0.0001410016,0.0000476664,0.0002317713,0.01006021,0.4928099,0.003653306,0.01103294,0.00006353988,0.1866032],"study_design_scores_gemma":[0.0003379637,0.00008923387,0.04762579,0.002548774,0.00002366889,0.000001715903,0.002012873,0.9124933,0.0223893,0.01064636,0.001144539,0.0006864934],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5200436,0.009314789,0.4577804,0.002994104,0.001917969,0.0008500117,0.000001014254,0.0001189505,0.006979183],"genre_scores_gemma":[0.9929852,0.002369495,0.0029405,0.0005284829,0.00008878201,0.0002665908,7.418957e-7,0.00004285908,0.0007773596],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4729416,"threshold_uncertainty_score":0.9995149,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1439787315026596,"score_gpt":0.3484576135299461,"score_spread":0.2044788820272865,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}