{"id":"W4414359199","doi":"10.24963/ijcai.2025/616","title":"StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment","year":2025,"lang":"en","type":"article","venue":"","topic":"Model Reduction and Neural Networks","field":"Physics and Astronomy","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Robustness (evolution); Spurious relationship; Leverage (statistics); Overfitting; Regularization (linguistics); Data modeling; Synthetic data; Statistical model","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00006591294,0.0001101679,0.0001663343,0.00004540195,0.00007141394,0.0000150097,0.0001067178,0.00002866104,0.0007893406],"category_scores_gemma":[4.841035e-7,0.00009717112,0.00009189554,0.0001259838,0.00002665798,0.00009544653,0.0000709466,0.0001011944,0.000005681411],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001451233,"about_ca_system_score_gemma":0.00002696312,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002514892,"about_ca_topic_score_gemma":0.000004752326,"domain_scores_codex":[0.9993112,0.00002259865,0.0002134288,0.0001818349,0.0001062081,0.0001647495],"domain_scores_gemma":[0.9996317,0.00002112333,0.00005714707,0.0001997948,0.00003995445,0.00005027809],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005195686,0.0003077942,0.002829925,0.00002949764,0.00017749,6.668157e-7,0.0001598619,0.5974919,0.00625017,0.3361987,0.02113218,0.03536988],"study_design_scores_gemma":[0.0007668474,0.00004434314,0.0002106216,0.00007237376,0.00005907439,3.812299e-7,0.0001702794,0.8890671,0.04427759,0.06222627,0.002826368,0.0002788176],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08321258,0.00003136165,0.8180051,0.0003031599,0.0001909672,0.0001283541,0.000006402041,0.00002611604,0.09809596],"genre_scores_gemma":[0.9900763,0.000003685392,0.001647669,0.00009716285,0.0000609886,0.000008304366,0.00001442365,0.000006140172,0.008085307],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9068637,"threshold_uncertainty_score":0.8642726,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03308157147254977,"score_gpt":0.2547135056095259,"score_spread":0.2216319341369761,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}