{"id":"W4323240305","doi":"10.5220/0011795500003411","title":"On the Convergence of Stochastic Gradient Descent in Low-Precision Number Formats","year":2023,"lang":"en","type":"article","venue":"","topic":"Parallel Computing and Optimization Techniques","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Polytechnique Montréal; Huawei Technologies (Canada)","funders":"","keywords":"Stochastic gradient descent; Convergence (economics); Computer science; Gradient descent; Descent (aeronautics); Mathematical optimization; Mathematics; Artificial intelligence; Engineering; Artificial neural network","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004147062,0.00006668659,0.00008340748,0.0000899512,0.00004703434,0.00002340307,0.000542948,0.00002451327,0.00002724871],"category_scores_gemma":[0.00008446952,0.00004294838,0.0000312624,0.0006625248,0.00002192468,0.00008631255,0.0001998275,0.00006817305,0.0001472719],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002180699,"about_ca_system_score_gemma":0.000018875,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001692138,"about_ca_topic_score_gemma":0.000002786279,"domain_scores_codex":[0.9992327,0.00004944173,0.0002011756,0.0001522366,0.0002087986,0.000155615],"domain_scores_gemma":[0.9992812,0.0002648766,0.0000557418,0.000326566,0.00004404925,0.00002753476],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001970187,0.0001749655,0.0006906227,0.00002474968,0.000007601727,0.000007532973,0.001906501,0.3888304,0.000100774,0.5757349,0.02135931,0.01114298],"study_design_scores_gemma":[0.00008482138,0.00003177478,0.001590488,0.00007853097,3.800902e-7,0.000001411829,0.00001442556,0.9802975,0.001865574,0.01595654,0.00001665497,0.00006188732],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.09137172,0.0000031811,0.9063882,0.0004004291,0.0001435124,0.0001378442,3.141749e-7,0.0002252952,0.001329508],"genre_scores_gemma":[0.991379,0.00001037187,0.008248686,0.0001908721,0.000003847006,0.000009787324,6.484825e-7,0.000002993665,0.0001538538],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9000072,"threshold_uncertainty_score":0.1892931,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02249299350856379,"score_gpt":0.2728288064891927,"score_spread":0.2503358129806288,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}