{"id":"W4414359199","doi":"10.24963/ijcai.2025/616","title":"StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment","year":2025,"lang":"en","type":"article","venue":"","topic":"Model Reduction and Neural Networks","field":"Physics and Astronomy","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Robustness (evolution); Spurious relationship; Leverage (statistics); Overfitting; Regularization (linguistics); Data modeling; Synthetic data; Statistical model","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001872669,0.001815697,0.001298551,0.0009572475,0.0006071219,0.001504168,0.003135776,0.001822366,0.002624572],"category_scores_gemma":[0.006767959,0.0005499701,0.001358869,0.0006068115,0.001378227,0.002528978,0.002683814,0.003562135,0.001715754],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001160768,"about_ca_system_score_gemma":0.001272853,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004918023,"about_ca_topic_score_gemma":0.006710108,"domain_scores_codex":[0.9988862,0.0002783191,0.00004240502,0.0004444269,0.0002087239,0.0001399088],"domain_scores_gemma":[0.9981812,0.0008128116,0.000183519,0.0004201934,0.0002390063,0.0001633063],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005790236,0.0004308843,0.003845647,0.0003408475,0.0002785582,0.0002694674,0.0005045696,0.5119605,0.03310403,0.01660995,0.01381502,0.4182615],"study_design_scores_gemma":[0.00001520762,0.00006304141,0.0002046078,0.00001297672,0.00001289541,0.00004106873,0.00003359728,0.9863064,0.003739818,0.008595914,0.0009596909,0.00001479927],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05141563,0.0005568549,0.9384069,0.0003014252,0.0001307607,0.00008571042,0.0002957135,0.006675495,0.002131512],"genre_scores_gemma":[0.7388197,0.0003895625,0.2459913,0.0009564993,0.0002080214,0.0002772742,0.003231486,0.001644849,0.00848125],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004918023,"threshold_uncertainty_score":0.009903789,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03308157147254977,"score_gpt":0.2547135056095259,"score_spread":0.2216319341369761,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}