{"id":"W6979256277","doi":"","title":"SGD as Free Energy Minimization: A Thermodynamic View on Neural Network Training","year":2025,"lang":"en","type":"article","venue":"ArXiv.org","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institut de Valorisation des Données; Canada First Research Excellence Fund","keywords":"Maxima and minima; Artificial neural network; Monotonic function; Stochastic gradient descent; Gradient descent; Energy (signal processing); Entropy (arrow of time); Function (biology)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003838886,0.001145442,0.001436981,0.001086741,0.0008475605,0.002029144,0.002159387,0.00215469,0.003059326],"category_scores_gemma":[0.01378962,0.000933128,0.0008922576,0.0008196106,0.003620438,0.003107934,0.002433144,0.003024448,0.0008176149],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00198048,"about_ca_system_score_gemma":0.001584001,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003224059,"about_ca_topic_score_gemma":0.003350365,"domain_scores_codex":[0.9986198,0.0007363391,0.00006525627,0.0002033822,0.0002877079,0.00008754894],"domain_scores_gemma":[0.9964483,0.002316518,0.0002341748,0.000474053,0.0003883449,0.0001386657],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00005087327,0.00003314952,0.00076815,0.0001126216,0.00004860722,0.00006849705,0.0001146085,0.7977727,0.001618391,0.1825593,0.001722219,0.0151309],"study_design_scores_gemma":[0.000006043593,0.00001948601,0.00007102716,0.0000149373,0.000003057555,0.00001165125,0.000007190036,0.9325792,0.0003922925,0.06642997,0.0004573803,0.000007702395],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01534035,0.0005453877,0.9776865,0.001293751,0.00008470067,0.00002887468,0.0000756716,0.0003981972,0.004546594],"genre_scores_gemma":[0.6552983,0.00138357,0.3313213,0.001278107,0.0002961619,0.0005357104,0.0004290697,0.001366142,0.00809166],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003838886,"threshold_uncertainty_score":0.02030218,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0284876120754896,"score_gpt":0.255307076511693,"score_spread":0.2268194644362034,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}