{"id":"W1772464306","doi":"10.48550/arxiv.1502.04390","title":"Equilibrated adaptive learning rates for non-convex optimization","year":2015,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":152,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Preconditioner; Hessian matrix; Saddle point; Computer science; Mathematical optimization; Rate of convergence; Curvature; Eigenvalues and eigenvectors; Convergence (economics); Stochastic gradient descent; Scheme (mathematics); Adaptive learning; Regular polygon; Convex optimization; Artificial neural network; Artificial intelligence; Applied mathematics; Mathematics; Iterative method; Mathematical analysis","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002232362,0.0007330938,0.0007469787,0.0004585594,0.0004161242,0.0007382189,0.001181775,0.001282952,0.003137112],"category_scores_gemma":[0.009335799,0.0004558929,0.0005261139,0.0004355834,0.00140029,0.001291485,0.001556881,0.002214947,0.001006378],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008586236,"about_ca_system_score_gemma":0.001291886,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001579896,"about_ca_topic_score_gemma":0.001824629,"domain_scores_codex":[0.9992526,0.0003929855,0.00003923323,0.00008593041,0.0001818073,0.0000474379],"domain_scores_gemma":[0.9978695,0.001287879,0.0001895166,0.0003166537,0.0002434265,0.00009308955],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001209337,0.00004550533,0.0005217041,0.00009214291,0.00003915793,0.00007904162,0.0001132437,0.847972,0.004920507,0.1011389,0.002217497,0.04273937],"study_design_scores_gemma":[0.00001027593,0.00001550125,0.000032292,0.000006571388,0.000001730458,0.000009498367,0.000003929569,0.98618,0.0009384227,0.01216906,0.0006279888,0.000004682549],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006644228,0.0001090815,0.9914568,0.0001515418,0.00002772989,0.00002879278,0.00001939593,0.000372626,0.001189904],"genre_scores_gemma":[0.2862096,0.0003340462,0.7073908,0.0002386367,0.00007088602,0.0003852336,0.0001687781,0.0004942725,0.004707639],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003137112,"threshold_uncertainty_score":0.01180595,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09230213855191799,"score_gpt":0.211123693247461,"score_spread":0.118821554695543,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}