{"id":"W7117277200","doi":"","title":"Saddle-to-Saddle Dynamics Explains A Simplicity Bias Across Neural Network Architectures","year":2025,"lang":"","type":"article","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canadian Institute for Advanced Research","keywords":"Simplicity; Initialization; Gradient descent; Invariant (physics); Convolutional neural network; Artificial neural network; Class (philosophy)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001882752,0.0005945097,0.0008992566,0.0008687852,0.0008077002,0.001259752,0.001086751,0.001440657,0.003753277],"category_scores_gemma":[0.01242984,0.0007095443,0.0008842356,0.0004783846,0.002315883,0.003195238,0.001670032,0.002096712,0.0005311552],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001219172,"about_ca_system_score_gemma":0.0007296566,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001920471,"about_ca_topic_score_gemma":0.001975125,"domain_scores_codex":[0.999541,0.0001508925,0.00002944656,0.0001257724,0.00009196223,0.00006084068],"domain_scores_gemma":[0.9968809,0.001755554,0.0004653176,0.0004033199,0.0003028385,0.0001920393],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001012969,0.00005661862,0.006057672,0.0001839889,0.0001127744,0.0004344126,0.0005665219,0.3931422,0.007773762,0.558405,0.005052657,0.02811302],"study_design_scores_gemma":[0.00001498222,0.00004720247,0.001193249,0.00002697798,0.00001112148,0.00008879251,0.00003855652,0.7331824,0.0008774236,0.2634583,0.001041235,0.00001979387],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1698253,0.0006848308,0.8159569,0.002629373,0.0000869994,0.00007261194,0.0001929371,0.0005435125,0.01000748],"genre_scores_gemma":[0.9447551,0.0005385742,0.04990233,0.0003458839,0.00006311431,0.0001181587,0.0001527016,0.0001961801,0.003928056],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003753277,"threshold_uncertainty_score":0.01255596,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06538742909950591,"score_gpt":0.2209794611678297,"score_spread":0.1555920320683238,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}