{"id":"W4323240305","doi":"10.5220/0011795500003411","title":"On the Convergence of Stochastic Gradient Descent in Low-Precision Number Formats","year":2023,"lang":"en","type":"article","venue":"","topic":"Parallel Computing and Optimization Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Polytechnique Montréal; Huawei Technologies (Canada)","funders":"","keywords":"Stochastic gradient descent; Convergence (economics); Computer science; Gradient descent; Descent (aeronautics); Mathematical optimization; Mathematics; Artificial intelligence; Engineering; Artificial neural network","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01075901,0.001973642,0.001281801,0.001724829,0.001175059,0.002623026,0.00185288,0.001625616,0.003804191],"category_scores_gemma":[0.07872908,0.000753416,0.001100316,0.001425816,0.005325745,0.005051965,0.003826264,0.004885591,0.001312975],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00233205,"about_ca_system_score_gemma":0.002246928,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004022803,"about_ca_topic_score_gemma":0.003457428,"domain_scores_codex":[0.9957722,0.001825206,0.0002432149,0.0005403298,0.001319373,0.0002996514],"domain_scores_gemma":[0.9521532,0.03880651,0.001752324,0.00269691,0.003909725,0.0006814052],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003931119,0.0001198256,0.002195673,0.0004498136,0.00008176737,0.000222606,0.0003207767,0.5331885,0.004019466,0.4101286,0.005089477,0.04379024],"study_design_scores_gemma":[0.000018794,0.00006125115,0.0002402669,0.0001399185,0.00001128035,0.00004043095,0.00002150632,0.9002222,0.001611975,0.09623872,0.001372724,0.00002098338],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02195499,0.002852319,0.9606388,0.001407995,0.0003415389,0.00008433705,0.0001169459,0.0004865831,0.01211655],"genre_scores_gemma":[0.5339325,0.005545478,0.4459412,0.001346622,0.00056947,0.0007324183,0.0007050083,0.001724536,0.009502775],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01075901,"threshold_uncertainty_score":0.05689979,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02249299350856379,"score_gpt":0.2728288064891927,"score_spread":0.2503358129806288,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}