{"id":"W4415610459","doi":"10.1016/j.csbj.2025.10.052","title":"Leveraging AutoML to optimize dataset selection for improved breast cancer variants pathogenicity prediction","year":2025,"lang":"en","type":"article","venue":"Computational and Structural Biotechnology Journal","topic":"AI in cancer detection","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"United Arab Emirates University","keywords":"Interpretability; Pathogenicity; Overfitting; Prioritization; Selection (genetic algorithm); Benchmarking; Feature selection; Ranking (information retrieval); Precision medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001908443,0.0001432541,0.0001569248,0.0003286554,0.0006508325,0.0001761286,0.0003389689,0.0001695946,0.000008772799],"category_scores_gemma":[0.00003240795,0.0001296369,0.00004048239,0.0004695847,0.00005679801,0.0003889166,0.0001702835,0.0003272132,6.506565e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002375794,"about_ca_system_score_gemma":0.0001946262,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002692586,"about_ca_topic_score_gemma":0.000006754124,"domain_scores_codex":[0.9989495,0.00003621995,0.0002794294,0.0003870742,0.0001094831,0.0002383439],"domain_scores_gemma":[0.999412,0.00005978049,0.0001308854,0.0001168781,0.0002086911,0.00007178183],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002650834,0.00002230335,0.001535195,0.00003903643,0.0002562962,0.000003175668,0.0001533899,0.245544,0.02309327,0.009884614,0.009424949,0.7097787],"study_design_scores_gemma":[0.0007146573,0.00009328674,0.02776236,0.00002890317,0.00002030494,0.0009389817,0.00001144438,0.934921,0.001210671,0.03330801,0.0008623227,0.0001280178],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05723258,0.00009298325,0.922217,0.01840485,0.001170737,0.0002343683,0.00049912,0.0001456921,0.000002679895],"genre_scores_gemma":[0.7831603,0.00003939393,0.2154253,0.001051796,0.0001958337,0.00003486846,0.00006350127,0.000007180564,0.00002187692],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7259277,"threshold_uncertainty_score":0.5286439,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009242350494047672,"score_gpt":0.2672117843807706,"score_spread":0.257969433886723,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}