{"meta":{"page":1,"per_page":50,"max_per_page":100,"total":271,"total_is_capped":false,"direct_labels_cover":1,"predictions_cover":271,"direct_label_status":"direct model label, unvalidated","prediction_status":"machine_predicted_unvalidated (Codex and Gemma teacher distillation)","score_status":"score_only:v0-immature-baseline (scores rank; they never assert a category)","snapshot":{"source":"OpenAlex, pinned release, all 482 partitions","release":"2026-06-24","frame_built":"2026-07-12","author_layer_release":"2026-06-26"},"query_hash":"4aff13888555","filters":{"topic":"Stochastic Gradient Optimization Techniques"}},"results":[{"id":"W1522301498","doi":"10.48550/arxiv.1412.6980","title":"Adam: A Method for Stochastic Optimization","year":2014,"lang":"en","type":"preprint","venue":"UvA-DARE (University of Amsterdam)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":84783,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Regret; Mathematical optimization; Computer science; Diagonal; Convergence (economics); Stochastic optimization; Rate of convergence; Optimization problem; Mathematics; Key (lock); Machine learning","authors":[{"name":"Diederik P. Kingma","is_ca":false},{"name":"Jimmy Ba","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01871386613063046,"gpt":0.2485319222798558,"spread":0.2298180561492253,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002091597,0.002131533,0.001959663,0.0008078784,0.0006086195,0.002179903,0.002379986,0.002511458,0.005956917],"category_scores_gemma":[0.006962539,0.001046243,0.00119912,0.0009757245,0.001689104,0.001983238,0.002792973,0.004100027,0.003399273],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008394011,"about_ca_system_score_gemma":0.001830585,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001740989,"about_ca_topic_score_gemma":0.002154346,"domain_scores_codex":[0.9984296,0.0006831514,0.0001133769,0.0002386052,0.0004497024,0.00008548558],"domain_scores_gemma":[0.9979012,0.001287078,0.0002068297,0.0001969585,0.0002874477,0.0001204911],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0000986482,0.00004229782,0.0005480289,0.0004442873,0.0001843592,0.0002467397,0.0001211376,0.6600494,0.002924374,0.1992064,0.02881358,0.1073207],"study_design_scores_gemma":[0.0000155567,0.00001836192,0.00004666455,0.00002878577,0.000009614378,0.00007413543,0.000005966088,0.925297,0.0006983391,0.06148333,0.01230713,0.00001526535],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0004418518,0.0003868858,0.9968882,0.0003422448,0.00009725681,0.00002314736,0.00007227437,0.0004635255,0.001284627],"genre_scores_gemma":[0.06240457,0.001785464,0.9222605,0.000549945,0.0004845559,0.0004774033,0.0006331974,0.00120291,0.01020139],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.005956917,"threshold_uncertainty_score":0.01992786,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W104184427","doi":"","title":"On the importance of initialization and momentum in deep learning","year":2013,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":3536,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Initialization; Momentum (technical analysis); Computer science; Recurrent neural network; Gradient descent; Stochastic gradient descent; Deep learning; Artificial intelligence; Deep neural networks; Artificial neural network; Schedule; Machine learning; Mathematical optimization; Algorithm; Mathematics","authors":[{"name":"Ilya Sutskever","is_ca":false},{"name":"James Martens","is_ca":true},{"name":"George E. Dahl","is_ca":true},{"name":"Geoffrey E. Hinton","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01169313606498904,"gpt":0.2239115137179905,"spread":0.2122183776530014,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007742895,0.001373461,0.001018042,0.0007394888,0.001111797,0.002136893,0.0009646331,0.002123482,0.001328377],"category_scores_gemma":[0.05319958,0.001073979,0.0004071493,0.001009419,0.003864856,0.006069802,0.002529216,0.005307974,0.0006796541],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001177029,"about_ca_system_score_gemma":0.001271661,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00442008,"about_ca_topic_score_gemma":0.003668925,"domain_scores_codex":[0.997547,0.001410128,0.0001420973,0.000345857,0.0004301381,0.0001248564],"domain_scores_gemma":[0.975794,0.01992361,0.0008815986,0.001383839,0.001604813,0.0004121189],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000707749,0.0001207109,0.005030699,0.0004025294,0.00008804473,0.0003536114,0.0003935376,0.50895,0.006347536,0.2259366,0.00722402,0.2444449],"study_design_scores_gemma":[0.00003981365,0.0001248487,0.0009039799,0.0001639114,0.00002844035,0.00008689453,0.00003119025,0.8940015,0.003321924,0.09868295,0.002565888,0.00004860476],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.03739695,0.01226426,0.9313169,0.003665625,0.0007005526,0.00007960347,0.00006379918,0.001099236,0.01341302],"genre_scores_gemma":[0.7206132,0.01025416,0.2616054,0.0008957024,0.001170595,0.0001728285,0.0001879182,0.0007382997,0.004361901],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007742895,"threshold_uncertainty_score":0.04094887,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963248893","doi":"10.1007/978-3-319-46128-1_50","title":"Linear Convergence of Gradient and Proximal-Gradient Methods Under the Polyak-Łojasiewicz Condition","year":2016,"lang":"en","type":"book-chapter","venue":"Lecture notes in computer science","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":832,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Convexity; Rate of convergence; Applied mathematics; Mathematics; Stochastic gradient descent; Convergence (economics); Gradient descent; Mathematical proof; Generalization; Simple (philosophy); Convex function; Regular polygon; Mathematical optimization; Computer science; Mathematical analysis; Artificial neural network; Artificial intelligence; Geometry","authors":[{"name":"Hamed Karimi","is_ca":true},{"name":"Julie Nutini","is_ca":true},{"name":"Mark Schmidt","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0238326173554937,"gpt":0.2977316453413589,"spread":0.2738990279858652,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004151328,0.002422076,0.002131816,0.001761552,0.0009485255,0.0024209,0.002601948,0.003166152,0.00664907],"category_scores_gemma":[0.02026464,0.0012,0.001658539,0.002122345,0.004622892,0.004621867,0.005113363,0.00649016,0.002435806],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00210358,"about_ca_system_score_gemma":0.002675335,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004509287,"about_ca_topic_score_gemma":0.002702877,"domain_scores_codex":[0.9980732,0.0009052703,0.00007612834,0.000264585,0.0005246105,0.0001562319],"domain_scores_gemma":[0.9937031,0.004480813,0.0002914511,0.000333815,0.0008952499,0.0002956958],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002636377,0.00009401357,0.0002826552,0.0005630734,0.00008455467,0.0000903968,0.0002683846,0.1353237,0.002085882,0.794345,0.01052876,0.05606997],"study_design_scores_gemma":[0.00003849199,0.00005553477,0.0001609013,0.00007322799,0.00002096415,0.00007348761,0.00003472249,0.6326576,0.0008239567,0.3615146,0.004509497,0.00003706985],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005550675,0.002804835,0.9717295,0.0009241711,0.0003935179,0.0000508765,0.00008592614,0.000214555,0.01824589],"genre_scores_gemma":[0.3076894,0.008777295,0.5827145,0.0009052804,0.001515148,0.0008417721,0.0006721281,0.001597445,0.09528704],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00664907,"threshold_uncertainty_score":0.02224338,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2951650375","doi":"10.48550/arxiv.1206.5533","title":"Practical recommendations for gradient-based training of deep architectures","year":2012,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":271,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Debugging; Artificial intelligence; Deep learning; Artificial neural network; Machine learning; Deep neural networks; Context (archaeology); Training (meteorology); Scale (ratio)","authors":[{"name":"Yoshua Bengio","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1800527121404644,"gpt":0.2611330049116545,"spread":0.08108029277119005,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01101225,0.003232137,0.001586742,0.001986867,0.001202547,0.00434386,0.00428475,0.007656978,0.02303966],"category_scores_gemma":[0.1060701,0.001970702,0.0009111528,0.002170185,0.00314244,0.01130817,0.002761703,0.01567171,0.02142708],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001596082,"about_ca_system_score_gemma":0.002271837,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002233365,"about_ca_topic_score_gemma":0.004232524,"domain_scores_codex":[0.9907064,0.005234632,0.0007962825,0.0007807988,0.002244379,0.000237581],"domain_scores_gemma":[0.9697416,0.01767019,0.0009857827,0.003251689,0.00747682,0.0008739908],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002130757,0.0003020409,0.0006936055,0.001301692,0.00009768544,0.0002676399,0.0003746291,0.04188014,0.003699231,0.2206464,0.3637465,0.3667774],"study_design_scores_gemma":[0.0003448372,0.0002057815,0.000466285,0.002463101,0.00005791949,0.0004204924,0.0003014549,0.1240719,0.005607204,0.5165094,0.3493378,0.000213754],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001242734,0.01412284,0.9188094,0.03897541,0.004976706,0.0002014889,0.000343975,0.004942434,0.01638503],"genre_scores_gemma":[0.02063367,0.01241045,0.9357203,0.008787625,0.002500548,0.0007816323,0.0005722755,0.003253388,0.01534024],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02303966,"threshold_uncertainty_score":0.07707536,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2604117713","doi":"10.48550/arxiv.1703.11008","title":"Computing Nonvacuous Generalization Bounds for Deep (Stochastic) Neural Networks with Many More Parameters than Training Data","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":250,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Overfitting; Generalization; Computer science; Artificial neural network; Maxima and minima; Regularization (linguistics); Early stopping; Artificial intelligence; Machine learning; Algorithm; Test data; Mathematics","authors":[{"name":"Gintare Karolina Dziugaite","is_ca":false},{"name":"Daniel M. Roy","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1449076541886231,"gpt":0.237001323538144,"spread":0.09209366934952087,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01145587,0.001828886,0.001579056,0.002202265,0.00105034,0.002462153,0.002633324,0.002480003,0.002722981],"category_scores_gemma":[0.08398829,0.001168568,0.001496202,0.001320153,0.006268711,0.008552341,0.005881782,0.007948782,0.0003464324],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004360782,"about_ca_system_score_gemma":0.001347206,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002470871,"about_ca_topic_score_gemma":0.002477351,"domain_scores_codex":[0.9951122,0.001853143,0.0002858731,0.001043815,0.001379805,0.0003251307],"domain_scores_gemma":[0.9325429,0.05809937,0.002377602,0.004693414,0.00143202,0.0008546971],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001458156,0.00006536584,0.002126064,0.0002388442,0.0001090237,0.0001187832,0.0002660317,0.596624,0.001860554,0.367309,0.001743474,0.02939308],"study_design_scores_gemma":[0.000005217831,0.00001980566,0.0002687967,0.00003920639,0.000007178782,0.00001924714,0.00001090148,0.7362145,0.0007545153,0.2622915,0.000357279,0.00001181908],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04942261,0.001855358,0.9402331,0.002048878,0.0001050014,0.00004286568,0.0001741458,0.0005440397,0.00557399],"genre_scores_gemma":[0.808029,0.001369499,0.1840615,0.001443496,0.0002608486,0.0003596781,0.0004876245,0.0006800176,0.003308282],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01145587,"threshold_uncertainty_score":0.0605852,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2075660001","doi":"10.1007/s10107-014-0800-2","title":"On the complexity analysis of randomized block-coordinate descent methods","year":2014,"lang":"en","type":"article","venue":"Mathematical Programming","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":215,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Mathematics; Convex function; Separable space; Block (permutation group theory); Convex optimization; Combinatorics; Coordinate descent; Rate of convergence; Convergence (economics); Function (biology); Regular polygon; Sequence (biology); Descent (aeronautics); Convex analysis; Applied mathematics; Mathematical optimization; Computer science; Mathematical analysis","authors":[{"name":"Zhaosong Lu","is_ca":true},{"name":"Lin Xiao","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.05267368180101976,"gpt":0.3311871699736866,"spread":0.2785134881726669,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008267175,0.002239938,0.002736044,0.001917812,0.001393267,0.003359248,0.003089527,0.002789018,0.006650513],"category_scores_gemma":[0.04935519,0.001259454,0.001634921,0.002348431,0.003697788,0.007766523,0.004730847,0.007768802,0.001069632],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003467527,"about_ca_system_score_gemma":0.004020049,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004932976,"about_ca_topic_score_gemma":0.004760074,"domain_scores_codex":[0.9938149,0.0031556,0.0002223863,0.0005141101,0.001873461,0.0004194728],"domain_scores_gemma":[0.9493425,0.04294986,0.001806749,0.002309727,0.002702427,0.0008887617],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003043475,0.0001567134,0.001060026,0.0003197157,0.00009874386,0.0001035979,0.0001439271,0.3368514,0.001472077,0.6201964,0.00822258,0.03107046],"study_design_scores_gemma":[0.00002476031,0.00003304065,0.0001905877,0.00002690427,0.00001420505,0.00001904392,0.00001135391,0.8420123,0.0003054271,0.1563769,0.0009699143,0.00001542248],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01048274,0.001550974,0.9782543,0.002235275,0.0002412655,0.00008903632,0.0001890597,0.0002211871,0.006736066],"genre_scores_gemma":[0.4548116,0.004925225,0.5113168,0.001812479,0.001916536,0.001483189,0.001230384,0.001334881,0.02116888],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008267175,"threshold_uncertainty_score":0.04372156,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4224983028","doi":"10.1109/jas.2022.105506","title":"Cooperative and Competitive Multi-Agent Systems: From Optimization to Games","year":2022,"lang":"en","type":"article","venue":"IEEE/CAA Journal of Automatica Sinica","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":199,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Windsor","funders":"Program of Shanghai Academic Research Leader; Project 211; Chinesisch-Deutsche Zentrum für Wissenschaftsförderung; National Natural Science Foundation of China","keywords":"Computer science; Optimization problem; Multi-agent system; Autonomy; Perspective (graphical); Mathematical optimization; Artificial intelligence","authors":[{"name":"Jianrui Wang","is_ca":false},{"name":"Yitian Hong","is_ca":false},{"name":"Jiali Wang","is_ca":false},{"name":"Jiapeng Xu","is_ca":true},{"name":"Yang Tang","is_ca":false},{"name":"Qing‐Long Han","is_ca":false},{"name":"Jürgen Kurths","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02163397452239797,"gpt":0.2678412780518937,"spread":0.2462073035294957,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001253143,0.001318691,0.00123559,0.0007679547,0.0005734647,0.002333296,0.001241759,0.001417671,0.001724723],"category_scores_gemma":[0.003263531,0.00048213,0.0008270568,0.001196001,0.00225441,0.002415485,0.001698471,0.002201796,0.0003214994],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001455297,"about_ca_system_score_gemma":0.001267639,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003265628,"about_ca_topic_score_gemma":0.001900943,"domain_scores_codex":[0.9987738,0.0006297348,0.00005957639,0.0001794753,0.0002693656,0.00008815675],"domain_scores_gemma":[0.9988432,0.0007967558,0.0001079347,0.00006359831,0.0001172142,0.00007140424],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00002825751,0.00004968428,0.0004940143,0.0003218864,0.00006849365,0.0001508958,0.0002295829,0.2382245,0.0005348782,0.7311069,0.003825733,0.02496512],"study_design_scores_gemma":[0.00001782543,0.00003993341,0.0002224326,0.00007822984,0.00002334601,0.00006449012,0.00008804764,0.4859487,0.0002069427,0.5011946,0.01209367,0.00002191863],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01174656,0.01873345,0.9379367,0.002814545,0.0003663339,0.0001453347,0.0001483191,0.0001243626,0.02798431],"genre_scores_gemma":[0.7174687,0.0373132,0.2264371,0.001389961,0.001427621,0.0008245975,0.0003088407,0.0001176623,0.01471232],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003265628,"threshold_uncertainty_score":0.0105589,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2754127623","doi":"10.1007/s11081-017-9366-1","title":"Best practices for comparing optimization algorithms","year":2017,"lang":"en","type":"article","venue":"Optimization and Engineering","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":189,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia, Okanagan Campus; University of British Columbia","funders":"","keywords":"Benchmarking; Best practice; Process (computing); Task (project management); Financial engineering; Optimization algorithm","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.05613976093467386,"gpt":0.2990190674639251,"spread":0.2428793065292512,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.06312083,0.004196924,0.005249151,0.01697858,0.003126682,0.01178327,0.008567775,0.006649917,0.0122159],"category_scores_gemma":[0.3444492,0.002109722,0.004791741,0.02027007,0.003392062,0.007511736,0.005472621,0.00835472,0.004378736],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003039992,"about_ca_system_score_gemma":0.00441021,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004962219,"about_ca_topic_score_gemma":0.005654003,"domain_scores_codex":[0.847999,0.08755508,0.02106064,0.006958569,0.03481982,0.001606855],"domain_scores_gemma":[0.7459372,0.1625101,0.006432149,0.05234816,0.03153537,0.001237137],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001670362,0.0009985302,0.00490206,0.01179483,0.005309477,0.0003583316,0.001048048,0.04926183,0.003988111,0.1449164,0.06180615,0.7139459],"study_design_scores_gemma":[0.00201031,0.001935465,0.007045638,0.01437925,0.00476137,0.001633548,0.002043014,0.1788602,0.03690433,0.5378146,0.2117373,0.0008750099],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.008789917,0.02655277,0.9354294,0.002487913,0.00243838,0.001181572,0.003203549,0.004878529,0.015038],"genre_scores_gemma":[0.04490902,0.004777846,0.9416788,0.0005962531,0.0003395788,0.002161136,0.002479673,0.001718011,0.001339788],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9368792,"threshold_uncertainty_score":0.3338189,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1772464306","doi":"10.48550/arxiv.1502.04390","title":"Equilibrated adaptive learning rates for non-convex optimization","year":2015,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":152,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Preconditioner; Hessian matrix; Saddle point; Computer science; Mathematical optimization; Rate of convergence; Curvature; Eigenvalues and eigenvectors; Convergence (economics); Stochastic gradient descent; Scheme (mathematics); Adaptive learning; Regular polygon; Convex optimization; Artificial neural network; Artificial intelligence; Applied mathematics; Mathematics; Iterative method; Mathematical analysis","authors":[{"name":"Yann Dauphin","is_ca":true},{"name":"Harm de Vries","is_ca":true},{"name":"Yoshua Bengio","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.09230213855191799,"gpt":0.211123693247461,"spread":0.118821554695543,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002232362,0.0007330938,0.0007469787,0.0004585594,0.0004161242,0.0007382189,0.001181775,0.001282952,0.003137112],"category_scores_gemma":[0.009335799,0.0004558929,0.0005261139,0.0004355834,0.00140029,0.001291485,0.001556881,0.002214947,0.001006378],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008586236,"about_ca_system_score_gemma":0.001291886,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001579896,"about_ca_topic_score_gemma":0.001824629,"domain_scores_codex":[0.9992526,0.0003929855,0.00003923323,0.00008593041,0.0001818073,0.0000474379],"domain_scores_gemma":[0.9978695,0.001287879,0.0001895166,0.0003166537,0.0002434265,0.00009308955],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001209337,0.00004550533,0.0005217041,0.00009214291,0.00003915793,0.00007904162,0.0001132437,0.847972,0.004920507,0.1011389,0.002217497,0.04273937],"study_design_scores_gemma":[0.00001027593,0.00001550125,0.000032292,0.000006571388,0.000001730458,0.000009498367,0.000003929569,0.98618,0.0009384227,0.01216906,0.0006279888,0.000004682549],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006644228,0.0001090815,0.9914568,0.0001515418,0.00002772989,0.00002879278,0.00001939593,0.000372626,0.001189904],"genre_scores_gemma":[0.2862096,0.0003340462,0.7073908,0.0002386367,0.00007088602,0.0003852336,0.0001687781,0.0004942725,0.004707639],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003137112,"threshold_uncertainty_score":0.01180595,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W1844261860","doi":"10.48550/arxiv.1301.3584","title":"Revisiting Natural Gradient for Deep Networks","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":122,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"Natural Sciences and Engineering Research Council of Canada; DeepMind; Compute Canada","keywords":"Natural (archaeology); Computer science; Artificial intelligence; Geology; Paleontology","authors":[{"name":"Razvan Pascanu","is_ca":true},{"name":"Yoshua Bengio","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04715239288676829,"gpt":0.1881851438096175,"spread":0.1410327509228492,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006234697,0.001696879,0.001245813,0.001506339,0.000834254,0.001887212,0.002268417,0.001944146,0.003412025],"category_scores_gemma":[0.02747593,0.0006065776,0.0008626238,0.001043731,0.002050272,0.005178347,0.002815229,0.002795655,0.0008416822],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001990848,"about_ca_system_score_gemma":0.002619635,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006603812,"about_ca_topic_score_gemma":0.0095542,"domain_scores_codex":[0.9973483,0.001223471,0.0001226967,0.0004359514,0.0007469711,0.000122599],"domain_scores_gemma":[0.9925799,0.004206953,0.0003856942,0.001110205,0.001454469,0.0002627624],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000286688,0.0002479226,0.003168881,0.0003097026,0.0001453499,0.00008295223,0.0001467429,0.7188414,0.002733563,0.1174567,0.007685822,0.1488942],"study_design_scores_gemma":[0.00001584097,0.00006718137,0.0001472344,0.00002113187,0.000006633535,0.00002218015,0.00000918909,0.968116,0.001047235,0.02908127,0.001457714,0.000008444632],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.029501,0.001234232,0.9606408,0.000745387,0.0002259747,0.000135647,0.0002683972,0.001701715,0.005546739],"genre_scores_gemma":[0.4288446,0.0006674969,0.5645424,0.0005538631,0.000182193,0.0002360052,0.0007231342,0.0007341122,0.003516186],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006603812,"threshold_uncertainty_score":0.03297257,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2596625124","doi":"","title":"Nearly-tight VC-dimension bounds for piecewise linear neural networks","year":2017,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":108,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo; University of British Columbia","funders":"","keywords":"Dimension (graph theory); Upper and lower bounds; Piecewise linear function; Mathematics; Combinatorics; Omega; Piecewise; VC dimension; Function (biology); Range (aeronautics); Artificial neural network; Discrete mathematics; Mathematical analysis; Physics; Computer science","authors":[{"name":"Nick Harvey","is_ca":true},{"name":"Chris Liaw","is_ca":true},{"name":"Abbas Mehrabian","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06326245405350339,"gpt":0.2035452813463818,"spread":0.1402828272928784,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004998351,0.003561106,0.002717022,0.003102455,0.001498986,0.004623688,0.003416214,0.00271658,0.00858715],"category_scores_gemma":[0.04550204,0.001443534,0.001805031,0.002969266,0.003847652,0.01014654,0.007208521,0.01062614,0.001777709],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003998405,"about_ca_system_score_gemma":0.001516146,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002652996,"about_ca_topic_score_gemma":0.002805754,"domain_scores_codex":[0.9960194,0.001205019,0.0001959215,0.0007822248,0.001124451,0.000673062],"domain_scores_gemma":[0.9689126,0.02334552,0.001325374,0.002787849,0.002481413,0.001147264],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004155225,0.0002047439,0.003092345,0.0007786527,0.000253623,0.0002669808,0.0004047153,0.4190646,0.0069906,0.4649099,0.0176756,0.08594283],"study_design_scores_gemma":[0.00001689231,0.00005717288,0.0006326798,0.000127207,0.00003878359,0.0001025167,0.0000364868,0.7330203,0.001927465,0.2604842,0.00351181,0.00004448112],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03964284,0.01128024,0.9161366,0.004517388,0.0004910865,0.0001079294,0.001116063,0.001444441,0.0252634],"genre_scores_gemma":[0.8035972,0.01011004,0.1631265,0.002955248,0.001796148,0.0009603001,0.002134087,0.001319016,0.01400141],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00858715,"threshold_uncertainty_score":0.02901053,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3091097978","doi":"10.1145/3452296.3472904","title":"Efficient sparse collective communication and its application to accelerate distributed deep learning","year":2021,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":105,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Kootenay Association for Science & Technology","funders":"China Scholarship Council; King Abdullah University of Science and Technology","keywords":"Computer science; Focus (optics); Distributed computing; Scale (ratio); Artificial intelligence","authors":[{"name":"Jiawei Fei","is_ca":false},{"name":"Chen-Yu Ho","is_ca":true},{"name":"Atal Narayan Sahu","is_ca":true},{"name":"Marco Canini","is_ca":true},{"name":"Amedeo Sapio","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01822701639295126,"gpt":0.2550134356046615,"spread":0.2367864192117102,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009924779,0.0007158447,0.0007899665,0.0005737995,0.0008225066,0.0009147287,0.001398764,0.0008485868,0.006029431],"category_scores_gemma":[0.006493226,0.0003056964,0.0004112441,0.0009791469,0.0007644723,0.001860524,0.002272806,0.001737383,0.001735667],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007366043,"about_ca_system_score_gemma":0.001423063,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00315066,"about_ca_topic_score_gemma":0.00678359,"domain_scores_codex":[0.9993394,0.0001634668,0.0000307378,0.0001039615,0.0002585995,0.0001037532],"domain_scores_gemma":[0.9978375,0.0009638665,0.0001220861,0.0005211395,0.0004018179,0.000153697],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005251075,0.0003162501,0.002205912,0.0002633719,0.00009327133,0.0002127833,0.0004285807,0.5608407,0.01638444,0.1012854,0.02829748,0.2891468],"study_design_scores_gemma":[0.00002423965,0.00003788515,0.0001245972,0.000008661669,0.000006192968,0.00002140168,0.00002394814,0.9685799,0.002473646,0.02584575,0.002845909,0.000007811968],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03917973,0.000604565,0.9441201,0.001274276,0.0003379424,0.00007206225,0.0001835288,0.004642118,0.00958557],"genre_scores_gemma":[0.6877358,0.0005508056,0.299794,0.0003973298,0.0002855653,0.0003772686,0.0005742103,0.0007490524,0.00953602],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006029431,"threshold_uncertainty_score":0.02017045,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2119200797","doi":"","title":"An Accelerated Proximal Coordinate Gradient Method","year":2014,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":85,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"","keywords":"Mathematical optimization; Dual (grammatical number); Convergence (economics); Proximal Gradient Methods; Computer science; Convex optimization; Empirical risk minimization; Minification; Coordinate descent; Gradient method; Regular polygon; Stochastic gradient descent; Rate of convergence; Convex function; Applied mathematics; Mathematics; Artificial intelligence; Artificial neural network; Key (lock); Geometry","authors":[{"name":"Qihang Lin","is_ca":false},{"name":"Zhaosong Lu","is_ca":true},{"name":"Lin Xiao","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02352433827712829,"gpt":0.2919534599160039,"spread":0.2684291216388756,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001109182,0.001039888,0.001350894,0.0007559778,0.0004914731,0.001038844,0.001625627,0.001379034,0.006317773],"category_scores_gemma":[0.003141656,0.0005533271,0.0007742126,0.0007048079,0.0008674701,0.001114752,0.00176162,0.001784966,0.002578594],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005461344,"about_ca_system_score_gemma":0.001892021,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002489129,"about_ca_topic_score_gemma":0.002074386,"domain_scores_codex":[0.9991397,0.0002930387,0.00002715278,0.0001319856,0.0003444312,0.00006361179],"domain_scores_gemma":[0.9993516,0.0001993098,0.00004937617,0.00009397102,0.0002510104,0.00005483744],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001936236,0.0001018076,0.0006079048,0.0002722,0.00009715436,0.0002207218,0.0001130162,0.6348212,0.01042102,0.142533,0.01733634,0.1932818],"study_design_scores_gemma":[0.00002632701,0.00003127433,0.00005091967,0.00000898933,0.000007785205,0.00004925208,0.000004959302,0.9852772,0.001152633,0.007804255,0.005576481,0.000009795914],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001291839,0.0001116293,0.9966087,0.0001015968,0.00006015408,0.00003241419,0.00002990792,0.0002711948,0.001492505],"genre_scores_gemma":[0.09746633,0.0003926658,0.8923697,0.0002428844,0.0001828807,0.0003531683,0.0002222107,0.0003611423,0.008408979],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006317773,"threshold_uncertainty_score":0.02113503,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2780752111","doi":"10.1007/s10589-020-00220-z","title":"Momentum and stochastic momentum for stochastic gradient, Newton, proximal point and subspace descent methods","year":2020,"lang":"en","type":"preprint","venue":"Computational Optimization and Applications","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":81,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal; Mila - Quebec Artificial Intelligence Institute","funders":"","keywords":"Iterated function; Stochastic gradient descent; Momentum (technical analysis); Mathematics; Rate of convergence; Stochastic optimization; Applied mathematics; Ball (mathematics); Stochastic approximation; Mathematical optimization; Mathematical analysis; Computer science; Finance; Artificial neural network","authors":[{"name":"Nicolas Loizou","is_ca":true},{"name":"Peter Richtárik","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03332620874769687,"gpt":0.320718223472419,"spread":0.2873920147247221,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003263012,0.001746168,0.001839419,0.001370671,0.0008950364,0.002364419,0.001639939,0.002990724,0.003983271],"category_scores_gemma":[0.01592976,0.0007475049,0.001011235,0.002890756,0.00302029,0.003639078,0.002345306,0.004955544,0.001435748],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001375346,"about_ca_system_score_gemma":0.002644965,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004386762,"about_ca_topic_score_gemma":0.004196927,"domain_scores_codex":[0.9982734,0.0008129227,0.00009223101,0.0002154866,0.0005163687,0.00008958897],"domain_scores_gemma":[0.9974171,0.001447865,0.0002017204,0.0002720524,0.0004992285,0.0001619749],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001077612,0.00009457194,0.0003872,0.0002940607,0.00007514485,0.00008530503,0.0001358386,0.1601732,0.001723599,0.7488347,0.0122076,0.07588104],"study_design_scores_gemma":[0.00001317172,0.00002685353,0.0001905938,0.00003322356,0.00001765017,0.00003627708,0.0000154061,0.7362049,0.0005806736,0.2555812,0.00727763,0.00002249134],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.00281172,0.002533095,0.9902812,0.0006309514,0.0004234188,0.00002820845,0.00006935365,0.0002205072,0.003001621],"genre_scores_gemma":[0.2095441,0.008262073,0.7348788,0.0007448133,0.002493819,0.0006131019,0.0006736057,0.00135728,0.04143241],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004386762,"threshold_uncertainty_score":0.01725668,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2597452529","doi":"10.48550/arxiv.1703.04782","title":"Online Learning Rate Adaptation with Hypergradient Descent","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":77,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Stochastic gradient descent; Gradient descent; Rate of convergence; Range (aeronautics); Computation; Convergence (economics); Adaptation (eye); Online machine learning; Descent (aeronautics); Mode (computer interface); Artificial intelligence; Mathematical optimization; Machine learning; Algorithm; Active learning (machine learning); Mathematics; Artificial neural network; Key (lock)","authors":[{"name":"Atılım Güneş Baydin","is_ca":false},{"name":"Robert Cornish","is_ca":false},{"name":"David Martínez-Rubio","is_ca":false},{"name":"Mark Schmidt","is_ca":true},{"name":"Frank Wood","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08496107352918601,"gpt":0.1946122829403172,"spread":0.1096512094111312,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003400802,0.002052066,0.002043532,0.001099707,0.0005334177,0.00165777,0.003248314,0.002394,0.004623402],"category_scores_gemma":[0.01446787,0.001031673,0.0009807439,0.0009955737,0.001589738,0.002464507,0.002894844,0.003974655,0.003906806],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008427134,"about_ca_system_score_gemma":0.001720617,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0016182,"about_ca_topic_score_gemma":0.001744533,"domain_scores_codex":[0.9976811,0.0008972067,0.0001443833,0.0003774527,0.0007582783,0.0001414212],"domain_scores_gemma":[0.9971619,0.001075033,0.0003065288,0.0007415597,0.0005831976,0.0001317719],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001956591,0.0001650297,0.0008390514,0.0003178433,0.0001911624,0.0002350155,0.0001759429,0.6382617,0.01193788,0.08374368,0.01347756,0.2504595],"study_design_scores_gemma":[0.00002175232,0.00003164817,0.0000745441,0.00001730999,0.000007425911,0.00004660653,0.000004147759,0.98198,0.002433177,0.0121508,0.003218342,0.0000142836],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001119152,0.0001661383,0.996478,0.00009803872,0.00007548844,0.00003712612,0.00001810089,0.0008371997,0.001170857],"genre_scores_gemma":[0.1219119,0.0004922214,0.8674846,0.000405998,0.0003143827,0.0005152091,0.0001981915,0.001219989,0.007457551],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004623402,"threshold_uncertainty_score":0.0179854,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2750933313","doi":"","title":"Distributed Second-Order Optimization using Kronecker-Factored Approximations","year":2017,"lang":"en","type":"article","venue":"International Conference on Learning Representations","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":72,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Stochastic gradient descent; Computer science; Computation; Overhead (engineering); Artificial neural network; Curvature; Algorithm; Machine learning; Scaling; Artificial intelligence; Mathematical optimization; Mathematics","authors":[{"name":"Jimmy Ba","is_ca":true},{"name":"Roger Grosse","is_ca":true},{"name":"James Martens","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08007162583441403,"gpt":0.3591140077257221,"spread":0.279042381891308,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001259782,0.001491032,0.001401315,0.0006953948,0.0005292895,0.001368831,0.001834884,0.00155109,0.005548259],"category_scores_gemma":[0.005070476,0.0006754549,0.001215432,0.0007404721,0.001243215,0.001595276,0.001402653,0.002310744,0.002409898],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001570702,"about_ca_system_score_gemma":0.00264406,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01526298,"about_ca_topic_score_gemma":0.02361878,"domain_scores_codex":[0.9993919,0.0001374782,0.00003593198,0.0001387838,0.0002225652,0.00007327985],"domain_scores_gemma":[0.9983338,0.0007625262,0.0001133301,0.0003137825,0.0003663312,0.0001103515],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005330813,0.00003626476,0.000501837,0.00006600987,0.00003314402,0.0000606196,0.00005154507,0.939988,0.001199962,0.02535835,0.003794902,0.028856],"study_design_scores_gemma":[0.000003713293,0.000003125243,0.00001637926,0.000002217198,9.474384e-7,0.000003656665,0.000001810042,0.9960103,0.0001104759,0.003513877,0.000331305,0.000002132304],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.004528487,0.000157352,0.9917511,0.0001775053,0.00007034942,0.00002767845,0.00008620641,0.0009390658,0.002262292],"genre_scores_gemma":[0.2591709,0.0003385366,0.7262094,0.0003129062,0.000142697,0.0002435339,0.0006843308,0.00121307,0.01168463],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01526298,"threshold_uncertainty_score":0.0303483,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2007755560","doi":"10.1007/s10208-014-9220-1","title":"Improved Bounds on Sample Size for Implicit Matrix Trace Estimators","year":2014,"lang":"en","type":"article","venue":"Foundations of Computational Mathematics","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":69,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"Ciência sem Fronteiras; Natural Sciences and Engineering Research Council of Canada","keywords":"TRACE (psycholinguistics); Estimator; Upper and lower bounds; Gaussian; Matrix (chemical analysis); Unit vector; Monte Carlo method; Probabilistic logic; Multivariate random variable","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.01812313942802826,"gpt":0.3075835547097815,"spread":0.2894604152817533,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.04672218,0.004561781,0.006141392,0.003590479,0.001800772,0.005862706,0.009751324,0.006339285,0.01214834],"category_scores_gemma":[0.3129743,0.00333275,0.003135629,0.003878652,0.007859194,0.01860583,0.01359313,0.0154471,0.002843204],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003057612,"about_ca_system_score_gemma":0.00549404,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001734886,"about_ca_topic_score_gemma":0.002281501,"domain_scores_codex":[0.973662,0.013718,0.001402584,0.003175856,0.006586351,0.001455273],"domain_scores_gemma":[0.5714717,0.3757657,0.005975422,0.03039274,0.01251192,0.003882558],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.003672138,0.0006638161,0.006738786,0.001379089,0.0006437342,0.0007715011,0.001093133,0.2697061,0.01517201,0.5272244,0.01115592,0.1617793],"study_design_scores_gemma":[0.0002584738,0.0002200328,0.0006830508,0.00013957,0.0001331128,0.0002018132,0.00006753077,0.7621347,0.003999674,0.2298439,0.002241777,0.00007635298],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006554619,0.0008313542,0.9881577,0.001287083,0.0002315407,0.0001355958,0.0002513338,0.0005655702,0.001985111],"genre_scores_gemma":[0.2076125,0.002138258,0.7736665,0.001678144,0.00185914,0.001813477,0.001542838,0.001775033,0.007914191],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.04672218,"threshold_uncertainty_score":0.2470934,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2900457592","doi":"","title":"Deep Nets Don't Learn via Memorization","year":2017,"lang":"en","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University; Polytechnique Montréal; Université de Montréal","funders":"","keywords":"Memorization; Computer science; Artificial intelligence; Mathematics education; Psychology","authors":[{"name":"David Krueger","is_ca":true},{"name":"Nicolas Ballas","is_ca":true},{"name":"Stanisław Jastrzȩbski","is_ca":false},{"name":"Devansh Arpit","is_ca":false},{"name":"Maxinder S Kanwal","is_ca":false},{"name":"Tegan Maharaj","is_ca":true},{"name":"Emmanuel Bengio","is_ca":true},{"name":"Asja Fischer","is_ca":false},{"name":"Aaron Courville","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01166250967440062,"gpt":0.2350985713370607,"spread":0.2234360616626601,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007328267,0.001070558,0.0009186123,0.0003367524,0.0003643545,0.001429858,0.002057171,0.001808806,0.01443703],"category_scores_gemma":[0.005447048,0.0008534127,0.0006062932,0.0004043082,0.001072358,0.004821208,0.002063323,0.003222055,0.004697471],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007121141,"about_ca_system_score_gemma":0.001066595,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001959404,"about_ca_topic_score_gemma":0.004396847,"domain_scores_codex":[0.9994954,0.00007353233,0.00002792021,0.0001554316,0.0001705882,0.00007716888],"domain_scores_gemma":[0.9981663,0.0007718101,0.000154825,0.0005870465,0.00022523,0.00009490782],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003556748,0.000206854,0.00126249,0.0003594315,0.0001510102,0.0001973432,0.00009012846,0.1699848,0.01361882,0.1117037,0.03157024,0.6704995],"study_design_scores_gemma":[0.00004015636,0.0001139722,0.0003783054,0.00003757931,0.00004631495,0.0001458104,0.00001853742,0.8768574,0.01072646,0.102333,0.009278419,0.00002398562],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02114241,0.0006389839,0.956246,0.001449304,0.0005018499,0.00007174303,0.000379466,0.004338693,0.01523144],"genre_scores_gemma":[0.6452709,0.001089375,0.2433648,0.001537991,0.0005262354,0.0003056941,0.001539021,0.001676055,0.1046898],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01443703,"threshold_uncertainty_score":0.04829663,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2798888671","doi":"","title":"Linear Stochastic Approximation: How Far Does Constant Step-Size and Iterate Averaging Go?","year":2018,"lang":"en","type":"article","venue":"International Conference on Artificial Intelligence and Statistics","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Alberta","funders":"","keywords":"Mathematics; Constant (computer programming); Applied mathematics; Computer science","authors":[{"name":"Chandrashekar Lakshminarayanan","is_ca":true},{"name":"Csaba Szepesvári","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06654015255569296,"gpt":0.3147389566761767,"spread":0.2481988041204837,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0119088,0.001604709,0.002721328,0.001088183,0.001050825,0.002758022,0.002776658,0.004805728,0.00663754],"category_scores_gemma":[0.07838089,0.0008411178,0.001183319,0.001100545,0.002585378,0.01137857,0.002652865,0.005819519,0.001970955],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001190552,"about_ca_system_score_gemma":0.002874085,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006763755,"about_ca_topic_score_gemma":0.006251047,"domain_scores_codex":[0.9958227,0.002089638,0.0002901591,0.0006570551,0.0008919717,0.0002484859],"domain_scores_gemma":[0.9757729,0.01807301,0.0006119612,0.002736271,0.002257371,0.0005485527],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00119941,0.0003918438,0.004124762,0.0008264009,0.000658955,0.0001844783,0.0003330613,0.1544605,0.00206885,0.2672717,0.03195211,0.5365279],"study_design_scores_gemma":[0.00008338896,0.00008952629,0.0007583342,0.0002893299,0.0001436469,0.00008124283,0.00009643961,0.8400038,0.001578568,0.1513156,0.005485469,0.00007449106],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0188351,0.01240075,0.9358034,0.01604063,0.00189806,0.00006676114,0.0001422758,0.001917338,0.01289576],"genre_scores_gemma":[0.5051268,0.00843999,0.4612401,0.005299798,0.002554909,0.0002160526,0.0003783353,0.002249092,0.01449485],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0119088,"threshold_uncertainty_score":0.06298053,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3034426742","doi":"","title":"On the Global Convergence Rates of Softmax Policy Gradient Methods","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":60,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Google (Canada); University of Alberta","funders":"","keywords":"Softmax function; Mathematics; Applied mathematics; Initialization; Rate of convergence; Bounded function; Entropy (arrow of time); Mathematical optimization; Computer science; Mathematical analysis; Physics; Artificial neural network; Artificial intelligence","authors":[{"name":"Jincheng Mei","is_ca":true},{"name":"Chenjun Xiao","is_ca":true},{"name":"Csaba Szepesvári","is_ca":true},{"name":"Dale Schuurmans","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1321246909531475,"gpt":0.2731406912845342,"spread":0.1410160003313867,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01399367,0.002029287,0.00178829,0.002040979,0.001016796,0.002657219,0.001903821,0.001870007,0.006353655],"category_scores_gemma":[0.08193297,0.0007869434,0.00140508,0.001180713,0.003803023,0.005344062,0.004316058,0.006235855,0.001529197],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001790141,"about_ca_system_score_gemma":0.002122564,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002244779,"about_ca_topic_score_gemma":0.0018338,"domain_scores_codex":[0.995894,0.00230904,0.0001768768,0.0005068696,0.000778091,0.0003351392],"domain_scores_gemma":[0.9517057,0.0409589,0.001542606,0.0023645,0.0026977,0.000730632],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0005591377,0.00012656,0.003173841,0.0006390379,0.0001542176,0.0001800132,0.0004527468,0.5007182,0.003348097,0.4093667,0.005316202,0.07596518],"study_design_scores_gemma":[0.00002673542,0.00009842859,0.0004148478,0.0001621654,0.00002571008,0.00005563247,0.00004126317,0.908459,0.001994324,0.08715637,0.001539153,0.00002628927],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0154223,0.002615289,0.9706143,0.001347542,0.0001752303,0.00008704802,0.0001034892,0.000492844,0.009142016],"genre_scores_gemma":[0.5800518,0.006189335,0.3935958,0.001592224,0.0007418306,0.0009044636,0.000558943,0.002073812,0.01429178],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01399367,"threshold_uncertainty_score":0.07400644,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2997709794","doi":"10.1609/aaai.v34i04.5793","title":"On the Discrepancy between the Theoretical Analysis and Practical Implementations of Compressed Communication for Distributed Deep Learning","year":2020,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":59,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Computer science; Implementation; Quantization (signal processing); Compression (physics); Convergence (economics); Compression ratio; Rate of convergence; Data compression; Bounded function; Upper and lower bounds; Algorithm; Data compression ratio; Layer (electronics); Theoretical computer science; Artificial intelligence; Image compression; Mathematics; Telecommunications; Image processing; Engineering; Channel (broadcasting)","authors":[{"name":"Aritra Dutta","is_ca":true},{"name":"El Houcine Bergou","is_ca":false},{"name":"Ahmed M. Abdelmoniem","is_ca":true},{"name":"Chen-Yu Ho","is_ca":true},{"name":"Atal Narayan Sahu","is_ca":true},{"name":"Marco Canini","is_ca":true},{"name":"Panos Kalnis","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03833580488631928,"gpt":0.3304518789392912,"spread":0.2921160740529719,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01574895,0.002826643,0.002247809,0.001940788,0.001723994,0.005618819,0.004718577,0.004782404,0.008091575],"category_scores_gemma":[0.1110867,0.001488319,0.001050881,0.00243326,0.007399196,0.01762972,0.006287971,0.01412249,0.002052861],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003017136,"about_ca_system_score_gemma":0.003196795,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001801168,"about_ca_topic_score_gemma":0.001741531,"domain_scores_codex":[0.987228,0.004985816,0.0006834485,0.00168795,0.004680285,0.0007345384],"domain_scores_gemma":[0.9036753,0.07658472,0.001983909,0.01087364,0.006113595,0.0007688852],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004787379,0.0002814427,0.001227983,0.001062643,0.00008487259,0.0002130314,0.0004495165,0.152606,0.003853462,0.700158,0.01444736,0.1251371],"study_design_scores_gemma":[0.00008989352,0.0002009354,0.0004758384,0.0006082924,0.0000334508,0.0003370827,0.0001994706,0.6279832,0.005707804,0.3560908,0.008199372,0.00007381194],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01954604,0.0148209,0.9260584,0.01555525,0.0007004965,0.0001223635,0.0002192926,0.0009618105,0.02201554],"genre_scores_gemma":[0.647765,0.02236801,0.3117165,0.005531863,0.002841788,0.001039646,0.0005544372,0.001239621,0.006943154],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01574895,"threshold_uncertainty_score":0.08328938,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2588576771","doi":"10.1109/allerton.2016.7852337","title":"Anytime coding for distributed computation","year":2016,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":59,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Matrix multiplication; Computation; Coding (social sciences); Theoretical computer science; Distributed computing; Latency (audio); Parallel computing; Algorithm; Mathematics","authors":[{"name":"Nuwan S. Ferdinand","is_ca":true},{"name":"Stark C. Draper","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02263475676915671,"gpt":0.2664820547924679,"spread":0.2438472980233112,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001054676,0.0006003215,0.0005820814,0.0004726953,0.0005947253,0.001174615,0.001294887,0.0007252984,0.004039011],"category_scores_gemma":[0.004780812,0.0002037914,0.0004446105,0.0009291663,0.001305152,0.001715683,0.001518488,0.001857716,0.0007742163],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001477923,"about_ca_system_score_gemma":0.001456521,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00202713,"about_ca_topic_score_gemma":0.002306842,"domain_scores_codex":[0.998978,0.0003292371,0.00004143893,0.00009839384,0.0004069962,0.0001459348],"domain_scores_gemma":[0.9981241,0.0007841749,0.0001364271,0.0005355361,0.0003226263,0.00009715125],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001777715,0.00004462528,0.0002212503,0.0001002821,0.00001552122,0.00009404455,0.0001288047,0.2356399,0.006163954,0.6924976,0.003783077,0.0611331],"study_design_scores_gemma":[0.00001668139,0.00003586358,0.0000416461,0.0000146802,0.000005312547,0.00003035395,0.00001349468,0.8722222,0.001974665,0.1217876,0.003846626,0.00001081401],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008261203,0.0003221763,0.9850745,0.0003531884,0.000143345,0.00004096224,0.0000461497,0.0002871465,0.005471365],"genre_scores_gemma":[0.5977463,0.0007375529,0.3897213,0.0003296388,0.0001921496,0.0002925093,0.0001537418,0.0001688256,0.01065802],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004039011,"threshold_uncertainty_score":0.01351184,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2964106020","doi":"","title":"Coordinate Descent Converges Faster with the Gauss-Southwell Rule Than Random Selection","year":2015,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":56,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Discovery Air (Canada); University of British Columbia","funders":"","keywords":"Gauss; Selection (genetic algorithm); Lipschitz continuity; Coordinate descent; Convergence (economics); Rate of convergence; Computer science; Mathematics; Mathematical economics; Algorithm; Mathematical optimization; Applied mathematics; Artificial intelligence; Key (lock); Pure mathematics","authors":[{"name":"Julie Nutini","is_ca":true},{"name":"Mark Schmidt","is_ca":true},{"name":"Issam Laradji","is_ca":true},{"name":"Michael P. Friedlander","is_ca":false},{"name":"Hoyt Koepke","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01799212104597355,"gpt":0.219382107153064,"spread":0.2013899861070904,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006108857,0.001059426,0.001778675,0.0009845458,0.0008038307,0.001573377,0.001684818,0.001635745,0.003068188],"category_scores_gemma":[0.03025976,0.0007011981,0.001020737,0.001111815,0.002159446,0.002638391,0.001518039,0.002249513,0.00173597],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008697577,"about_ca_system_score_gemma":0.001955078,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003621527,"about_ca_topic_score_gemma":0.005077838,"domain_scores_codex":[0.9959484,0.001777112,0.000278666,0.0007233043,0.001075302,0.0001973251],"domain_scores_gemma":[0.9865727,0.008540024,0.0007179389,0.002560221,0.001392018,0.0002171334],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003618814,0.0001351674,0.00404238,0.0003281244,0.0002757423,0.0001673226,0.0001849342,0.589403,0.006424522,0.2282913,0.009302209,0.1610834],"study_design_scores_gemma":[0.00005338757,0.0001210062,0.0004109555,0.00002512153,0.00002274982,0.0000956999,0.0000181924,0.9519672,0.003285557,0.04021396,0.003766149,0.00002004494],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01153778,0.0004111574,0.9842075,0.0004086744,0.0001002404,0.00005490103,0.00003027918,0.0004595738,0.002789836],"genre_scores_gemma":[0.2645652,0.000893996,0.7248475,0.0007326021,0.0001985265,0.0003611502,0.0002771251,0.0005731041,0.007550743],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006108857,"threshold_uncertainty_score":0.03230709,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2962705652","doi":"","title":"Stop wasting my gradients: practical SVRG","year":2015,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":50,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Computer science; Convergence (economics); Variance (accounting); Computation; Generalization; Rate of convergence; Selection (genetic algorithm); Mathematical optimization; Algorithm; Artificial intelligence; Applied mathematics; Mathematics; Channel (broadcasting)","authors":[{"name":"Reza Babanezhad","is_ca":true},{"name":"Mohamed Osama Ahmed","is_ca":true},{"name":"Alim Virani","is_ca":true},{"name":"Mark Schmidt","is_ca":true},{"name":"Jakub Konečný","is_ca":false},{"name":"Scott Sallinen","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06114805913386867,"gpt":0.3037481648630557,"spread":0.2426001057291871,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002435043,0.001066796,0.001197105,0.0004043201,0.0003374846,0.0007545779,0.001425605,0.001568382,0.003034511],"category_scores_gemma":[0.008626001,0.0005793168,0.0004319262,0.0004322841,0.001063473,0.001278639,0.001058344,0.001749974,0.0009639651],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000471142,"about_ca_system_score_gemma":0.0009549641,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002547445,"about_ca_topic_score_gemma":0.003399451,"domain_scores_codex":[0.9992125,0.0003559495,0.00003859109,0.0001420346,0.0001801499,0.00007078898],"domain_scores_gemma":[0.9980379,0.001211707,0.0001404345,0.0002428471,0.0003039444,0.0000631718],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002230251,0.0000819075,0.0007971236,0.0001498188,0.00006107706,0.0001906596,0.0001374432,0.792861,0.006773399,0.04079518,0.005463923,0.1524654],"study_design_scores_gemma":[0.000009002326,0.00002331881,0.00004363709,0.000005984913,0.00000293955,0.00001845564,0.000005194509,0.993395,0.0009294191,0.00478014,0.0007822517,0.000004683807],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007528479,0.0001861935,0.990319,0.0002439424,0.00003720119,0.00003503454,0.0000211751,0.0004108235,0.001218171],"genre_scores_gemma":[0.3266668,0.0003134601,0.6672269,0.0003530164,0.00007796966,0.0001735196,0.0001656175,0.0003801031,0.004642684],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003034511,"threshold_uncertainty_score":0.01287788,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3034995656","doi":"10.24963/ijcai.2020/452","title":"Closing the Generalization Gap of Adaptive Gradient Methods in Training Deep Neural Networks","year":2020,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":49,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Canadian Institute for Advanced Research; University of Pennsylvania","keywords":"Stochastic gradient descent; Gradient descent; Computer science; Artificial neural network; Convergence (economics); Generalization; Closing (real estate); Artificial intelligence; Momentum (technical analysis); Gradient method; Stationary point; Deep learning; Rate of convergence; Algorithm; Mathematical optimization; Mathematics; Key (lock); Law","authors":[{"name":"Jinghui Chen","is_ca":false},{"name":"Dongruo Zhou","is_ca":false},{"name":"Yiqi Tang","is_ca":false},{"name":"Ziyan Yang","is_ca":false},{"name":"Yuan Cao","is_ca":false},{"name":"Quanquan Gu","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.1055841967632464,"gpt":0.3277355163136001,"spread":0.2221513195503537,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006920116,0.001294033,0.001182148,0.0006463628,0.0005888526,0.001142022,0.001412679,0.001619502,0.001382891],"category_scores_gemma":[0.02508292,0.0007236548,0.0007865783,0.0006888628,0.002269288,0.002838581,0.00250797,0.003852788,0.0004873198],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000856728,"about_ca_system_score_gemma":0.001520839,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002623524,"about_ca_topic_score_gemma":0.002313192,"domain_scores_codex":[0.9974449,0.001333565,0.0001835211,0.0003630792,0.0005530829,0.0001220583],"domain_scores_gemma":[0.991197,0.006072931,0.0005017111,0.001186129,0.0008596667,0.0001826745],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002640089,0.00007745416,0.002324225,0.0002419643,0.0001475545,0.0001370681,0.0002927728,0.7378103,0.004540056,0.07096955,0.004170612,0.1790245],"study_design_scores_gemma":[0.00001077936,0.00004614367,0.0001480009,0.00002303366,0.000007405546,0.0000287305,0.000009808697,0.9809826,0.001209411,0.01662083,0.0009067272,0.000006407206],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02040304,0.001089124,0.9752467,0.0008535575,0.0001049015,0.00003720525,0.00002455545,0.0006114608,0.001629466],"genre_scores_gemma":[0.5474535,0.001550766,0.4455309,0.000843711,0.0002333811,0.0002406524,0.0001942957,0.0006731842,0.003279637],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006920116,"threshold_uncertainty_score":0.03659749,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3035353486","doi":"","title":"From Local SGD to Local Fixed Point Methods for Federated Learning","year":2020,"lang":"en","type":"article","venue":"International Conference on Machine Learning","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":46,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Bottleneck; Computer science; Fixed point; Saddle point; Mathematical optimization; Context (archaeology); Computation; Operator (biology); Saddle; Convergence (economics); Theoretical computer science; Mathematics; Algorithm","authors":[{"name":"Grigory Malinovskiy","is_ca":false},{"name":"Dmitry Kovalev","is_ca":true},{"name":"Elnur Gasanov","is_ca":true},{"name":"Laurent Condat","is_ca":true},{"name":"Peter Richtárik","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.0574492059463758,"gpt":0.363646518265808,"spread":0.3061973123194321,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003803421,0.001409313,0.001990894,0.0008715646,0.0006392234,0.001581953,0.002218898,0.002048092,0.002718745],"category_scores_gemma":[0.01083648,0.0006722663,0.0009575197,0.001013332,0.001982125,0.001914265,0.003167066,0.003180468,0.001021857],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001225314,"about_ca_system_score_gemma":0.001583523,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00260024,"about_ca_topic_score_gemma":0.002731251,"domain_scores_codex":[0.9986058,0.0006615659,0.00006943589,0.000268091,0.0003139944,0.00008108508],"domain_scores_gemma":[0.9959548,0.002545146,0.0002640559,0.0005559997,0.0005013242,0.0001787953],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001123273,0.00006862826,0.0005510669,0.0001308589,0.00006696858,0.0000662447,0.0001033675,0.8888733,0.001105167,0.04755024,0.00198851,0.05938331],"study_design_scores_gemma":[0.0000111515,0.00002143659,0.00002963233,0.00001013424,0.000003780417,0.000008051502,0.000007820733,0.9747167,0.0002750527,0.0243892,0.0005228007,0.000004323923],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002594231,0.0001941011,0.9961346,0.0001399346,0.00003125622,0.00002173106,0.00001750991,0.0002773881,0.0005892293],"genre_scores_gemma":[0.3300406,0.000599226,0.6635331,0.0003824903,0.0001542744,0.0004328627,0.0002507199,0.0005098011,0.00409675],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003803421,"threshold_uncertainty_score":0.02011466,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4205547947","doi":"10.1561/2400000036","title":"Acceleration Methods","year":2021,"lang":"en","type":"article","venue":"Foundations and Trends® in Optimization","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":45,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Mila - Quebec Artificial Intelligence Institute","funders":"Agence Nationale de la Recherche","keywords":"Acceleration; Convergence (economics); Momentum (technical analysis); Computer science; Mathematical optimization; Mathematical proof; Quadratic equation; Range (aeronautics); Chebyshev filter; Key (lock); Set (abstract data type); Cover (algebra); Quadratic programming; Mathematics; Applied mathematics; Physics; Mechanical engineering; Engineering","authors":[{"name":"Alexandre d’Aspremont","is_ca":false},{"name":"Damien Scieur","is_ca":true},{"name":"Adrien Taylor","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03732282273889075,"gpt":0.3584317859963982,"spread":0.3211089632575074,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001437686,0.001987837,0.001306207,0.001258122,0.0008000901,0.002394646,0.002637776,0.001550852,0.06547971],"category_scores_gemma":[0.006062525,0.000788604,0.001434524,0.001231727,0.001043936,0.002504552,0.003561753,0.002834341,0.03225572],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009415932,"about_ca_system_score_gemma":0.001345966,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001375957,"about_ca_topic_score_gemma":0.001428046,"domain_scores_codex":[0.9984976,0.0003010365,0.00009551237,0.0003095185,0.0006786118,0.0001177841],"domain_scores_gemma":[0.9984964,0.0005426631,0.0000903149,0.0004052776,0.0003673919,0.00009789389],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.000157699,0.0001018122,0.0006962787,0.0007131472,0.0000952869,0.000123775,0.0001852855,0.05640285,0.003898896,0.3976249,0.06510717,0.4748929],"study_design_scores_gemma":[0.00009168928,0.0001205183,0.0004833375,0.0003208276,0.00005516359,0.0003470284,0.00008808242,0.2874309,0.003607276,0.2761586,0.4312228,0.00007377945],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001106037,0.002786179,0.961844,0.000569135,0.0008330851,0.0001298472,0.0003598888,0.002261202,0.03011066],"genre_scores_gemma":[0.0693767,0.007823968,0.8144653,0.001117216,0.001424235,0.0009101023,0.002258268,0.004166923,0.0984573],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.06547971,"threshold_uncertainty_score":0.2190515,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2889576094","doi":"","title":"Stochastic Nested Variance Reduced Gradient Descent for Nonconvex Optimization.","year":2018,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":43,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Mathematics; Variance reduction; Gradient descent; Combinatorics; Nabla symbol; Stationary point; Function (biology); Stochastic gradient descent; Applied mathematics; Mathematical analysis; Computer science; Physics; Statistics; Omega","authors":[{"name":"Dongruo Zhou","is_ca":false},{"name":"Pan Xu","is_ca":true},{"name":"Quanquan Gu","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02298046378812457,"gpt":0.2619998012515888,"spread":0.2390193374634642,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001373686,0.001649598,0.001542335,0.0005421338,0.0004383829,0.0009066197,0.001292051,0.001401556,0.001893755],"category_scores_gemma":[0.003731821,0.0007623142,0.001212968,0.0006235393,0.001184697,0.001137239,0.001356108,0.002117727,0.0007528597],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001207564,"about_ca_system_score_gemma":0.001890871,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006597762,"about_ca_topic_score_gemma":0.008562855,"domain_scores_codex":[0.9992462,0.0003190605,0.00003118412,0.0001284372,0.0002058708,0.00006923774],"domain_scores_gemma":[0.9987977,0.0006911412,0.0001222485,0.00008997553,0.000225717,0.0000731613],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004631155,0.00004036,0.0004834513,0.0001517532,0.00007267822,0.00009201048,0.00004288955,0.9478576,0.001494524,0.02357722,0.003161846,0.02297935],"study_design_scores_gemma":[0.000003123154,0.000008384971,0.00002828029,0.000003813294,0.000002059909,0.000006642351,0.000001958264,0.9963439,0.0001274637,0.003110013,0.000362008,0.00000233578],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003946965,0.0004103611,0.9937571,0.0002069781,0.00004283264,0.00003170019,0.00003941704,0.0002017182,0.00136282],"genre_scores_gemma":[0.3432059,0.001025295,0.6449481,0.0005405983,0.0001807753,0.0004282949,0.0006559243,0.00050307,0.008512152],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006597762,"threshold_uncertainty_score":0.01311868,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2965944281","doi":"","title":"Tight analyses for non-smooth stochastic gradient descent","year":2019,"lang":"en","type":"article","venue":"Conference on Learning Theory","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":41,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Mathematics; Lipschitz continuity; Stochastic gradient descent; Differentiable function; Combinatorics; Convex function; Gradient descent; Upper and lower bounds; Regular polygon; Discrete mathematics; Applied mathematics; Mathematical analysis; Computer science","authors":[{"name":"Nicholas J. A. Harvey","is_ca":true},{"name":"Christopher Liaw","is_ca":true},{"name":"Yaniv Plan","is_ca":true},{"name":"Sikander Randhawa","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04690993015189428,"gpt":0.3102476221312967,"spread":0.2633376919794024,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02689398,0.005478594,0.005683759,0.004258015,0.003440413,0.005118314,0.006526676,0.00547856,0.01155368],"category_scores_gemma":[0.1309287,0.002581611,0.005286602,0.002817784,0.007728141,0.01225153,0.01086107,0.0144837,0.002261876],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.007805124,"about_ca_system_score_gemma":0.005633266,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008286189,"about_ca_topic_score_gemma":0.006163376,"domain_scores_codex":[0.9879396,0.004328775,0.0006049093,0.002113406,0.003738483,0.001274775],"domain_scores_gemma":[0.9178297,0.05936402,0.005036654,0.007683893,0.007581455,0.002504308],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004304193,0.000189938,0.003074142,0.0008487701,0.0003434249,0.0003481624,0.0005948542,0.3736889,0.003638049,0.5788928,0.009510169,0.02844047],"study_design_scores_gemma":[0.00002887607,0.0001121183,0.0006552244,0.0001649774,0.00007747229,0.00007474286,0.00004978207,0.7913679,0.001172443,0.2033768,0.002871656,0.00004804743],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01173335,0.003163206,0.9712432,0.002678832,0.0002855611,0.0001271436,0.0002373122,0.0006427363,0.009888599],"genre_scores_gemma":[0.5875375,0.006520189,0.3614404,0.00516221,0.001881202,0.001473719,0.001625798,0.003211356,0.0311477],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02689398,"threshold_uncertainty_score":0.1422306,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2995291884","doi":"","title":"On Solving Minimax Optimization Locally: A Follow-the-Ridge Approach","year":2020,"lang":"en","type":"article","venue":"International Conference on Learning Representations","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":38,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Minimax; Mathematical optimization; Convergence (economics); Gradient descent; Optimization problem; Computer science; Mathematics; Artificial intelligence; Artificial neural network","authors":[{"name":"Yuanhao Wang","is_ca":false},{"name":"Guodong Zhang","is_ca":true},{"name":"Jimmy Ba","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.06320326867818603,"gpt":0.3032700120988561,"spread":0.2400667434206701,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002471987,0.001301906,0.00205332,0.0006418698,0.0007054039,0.0009383641,0.001637926,0.002090576,0.003770327],"category_scores_gemma":[0.006949699,0.0007704822,0.0009347555,0.0006045498,0.002047616,0.002243735,0.002577999,0.003072939,0.001152431],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006792238,"about_ca_system_score_gemma":0.001342067,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001472986,"about_ca_topic_score_gemma":0.002066458,"domain_scores_codex":[0.9991731,0.0004143677,0.00003344487,0.0001385388,0.0001648393,0.00007567622],"domain_scores_gemma":[0.9976175,0.001664064,0.0001616842,0.000248399,0.0002091573,0.00009902862],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001209412,0.0001127804,0.0008519823,0.0002147292,0.0000898106,0.0001607431,0.0001902709,0.7750995,0.003129507,0.140775,0.004915725,0.07433911],"study_design_scores_gemma":[0.00001554415,0.00005513547,0.00004497288,0.00001912921,0.000006002134,0.00003074246,0.00001160196,0.9674944,0.0003765194,0.03111525,0.0008230974,0.00000749947],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006154044,0.0003913133,0.9897442,0.0003806731,0.00004364647,0.00003978227,0.00001580906,0.0003245413,0.002905884],"genre_scores_gemma":[0.4170362,0.0009272269,0.5683541,0.001116469,0.0002124348,0.000572884,0.0001543535,0.0007812312,0.01084518],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003770327,"threshold_uncertainty_score":0.01307327,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3024230214","doi":"","title":"Stochastic Nested Variance Reduction for Nonconvex Optimization","year":2018,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":37,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"","keywords":"Variance reduction; Mathematics; Combinatorics; Nabla symbol; Gradient descent; Function (biology); Stationary point; Reduction (mathematics); Applied mathematics; Mathematical analysis; Computer science; Physics; Geometry; Statistics; Omega","authors":[{"name":"Dongruo Zhou","is_ca":false},{"name":"Pan Xu","is_ca":true},{"name":"Quanquan Gu","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01973754399397216,"gpt":0.2620247578532457,"spread":0.2422872138592735,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001395178,0.001279604,0.001321775,0.0004684037,0.000420235,0.0009223915,0.001203392,0.001095783,0.001870655],"category_scores_gemma":[0.003684102,0.0006036705,0.001219449,0.0005025237,0.001184038,0.001050518,0.001430843,0.001870436,0.0005148474],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00110071,"about_ca_system_score_gemma":0.001475189,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005269673,"about_ca_topic_score_gemma":0.005511289,"domain_scores_codex":[0.9990895,0.0003523784,0.00003317594,0.0001752694,0.0002704607,0.00007914572],"domain_scores_gemma":[0.9986869,0.0007967416,0.0001178506,0.0001036944,0.0002296227,0.0000651844],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00003484732,0.00003085659,0.0003410725,0.00009573928,0.0000458828,0.00007489479,0.00003860139,0.9541827,0.001585473,0.02445725,0.00152939,0.01758328],"study_design_scores_gemma":[0.000001940292,0.000006425724,0.00002327624,0.000002528252,0.000001550651,0.000004672488,0.000001571898,0.9961641,0.0001467357,0.003406374,0.0002389083,0.000002012795],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005010766,0.0002507737,0.9929288,0.0001667602,0.00003323472,0.00002070717,0.0000274241,0.0001535065,0.001408078],"genre_scores_gemma":[0.4962823,0.0008207809,0.4920969,0.0004382794,0.000179111,0.000379079,0.0004759936,0.0004947618,0.008832836],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005269673,"threshold_uncertainty_score":0.01047802,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4389986737","doi":"10.1137/1.9781611977806.ch28","title":"Chapter 28: Subgradient Methods","year":2023,"lang":"en","type":"book-chapter","venue":"Society for Industrial and Applied Mathematics eBooks","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":37,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo; University of British Columbia, Okanagan Campus; University of British Columbia","funders":"","keywords":"Subgradient method; Computer science; Machine learning","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.1119871231347802,"gpt":0.2978296290613603,"spread":0.1858425059265801,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006241975,0.001695897,0.001090687,0.0008784767,0.0004652814,0.001766549,0.00104052,0.001015818,0.04495889],"category_scores_gemma":[0.002170949,0.0005467682,0.0009742132,0.001415208,0.0007862232,0.00209794,0.001129679,0.003115964,0.03291667],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007221919,"about_ca_system_score_gemma":0.0009313985,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001259141,"about_ca_topic_score_gemma":0.001730068,"domain_scores_codex":[0.999374,0.0001044968,0.00002958417,0.0001210223,0.0003343707,0.00003651848],"domain_scores_gemma":[0.9996585,0.0001556354,0.00001382946,0.00005724219,0.00009459323,0.00002018704],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00004733003,0.00007656975,0.000121773,0.0009661152,0.00006190739,0.00008183083,0.000134072,0.02363399,0.003661203,0.2548273,0.2483156,0.4680723],"study_design_scores_gemma":[0.00001934076,0.00003654212,0.0002280616,0.0003818881,0.00003157888,0.0002924143,0.00003388698,0.04226122,0.004077066,0.2025838,0.7500225,0.00003182252],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"other","genre_scores_codex":[0.0008307183,0.02989553,0.8306999,0.001374301,0.00212352,0.0001116012,0.0005741605,0.00164227,0.132748],"genre_scores_gemma":[0.0279922,0.06249163,0.5773309,0.002175673,0.00257966,0.0004531952,0.002335118,0.004988346,0.3196533],"genre_candidate":"other","genre_consensus":null,"teacher_disagreement_score":0.04495889,"threshold_uncertainty_score":0.1504025,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4288079579","doi":"10.1145/3419111.3421299","title":"Semi-dynamic load balancing","year":2020,"lang":"en","type":"preprint","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":34,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Load balancing (electrical power); Sizing; Distributed computing; Software deployment; Python (programming language); Execution time; Synchronization (alternating current); Key (lock); Parallel computing; Operating system; Computer network","authors":[{"name":"Chen Chen","is_ca":false},{"name":"Qizhen Weng","is_ca":false},{"name":"Wei Wang","is_ca":false},{"name":"Baochun Li","is_ca":true},{"name":"Bo Li","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01710817377559423,"gpt":0.2580077198261286,"spread":0.2408995460505344,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001738724,0.001261116,0.001066783,0.0006615272,0.001127664,0.001771229,0.003345517,0.0008276863,0.007382415],"category_scores_gemma":[0.006300951,0.0006283458,0.0006474692,0.000759723,0.0009996493,0.002523807,0.003220622,0.001600718,0.003611532],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001083891,"about_ca_system_score_gemma":0.002503645,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003711535,"about_ca_topic_score_gemma":0.004049156,"domain_scores_codex":[0.9981561,0.0003223605,0.0001254035,0.0005516003,0.0005286467,0.0003158217],"domain_scores_gemma":[0.9971812,0.0006294647,0.0001764215,0.00110724,0.0006259597,0.0002797053],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001624444,0.0006133773,0.005494565,0.0003298548,0.0001626988,0.0002027393,0.0007937268,0.5114304,0.07273629,0.02615791,0.03466348,0.3457905],"study_design_scores_gemma":[0.00007653624,0.00008691464,0.0007094544,0.00001089407,0.00001522313,0.00004303095,0.00006624463,0.968313,0.01187482,0.011269,0.007511671,0.00002329116],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06493963,0.0003275622,0.906758,0.0006213984,0.0002550123,0.0002106129,0.000432585,0.01754053,0.008914608],"genre_scores_gemma":[0.7353299,0.0001967687,0.2507843,0.0005317621,0.0001909138,0.0005590022,0.001392059,0.002719392,0.008295787],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007382415,"threshold_uncertainty_score":0.02469665,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2996067004","doi":"","title":"Generalization of Two-layer Neural Networks: An Asymptotic Viewpoint","year":2020,"lang":"en","type":"article","venue":"International Conference on Learning Representations","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":34,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Initialization; Generalization; Gradient descent; Layer (electronics); Artificial neural network; Population; Mathematics; Computer science; Flow (mathematics); Applied mathematics; Mathematical analysis; Artificial intelligence; Geometry; Chemistry","authors":[{"name":"Jimmy Ba","is_ca":true},{"name":"Murat A. Erdogdu","is_ca":true},{"name":"Taiji Suzuki","is_ca":false},{"name":"Denny Wu","is_ca":true},{"name":"Tianzong Zhang","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.08250555733982355,"gpt":0.3510375405511749,"spread":0.2685319832113514,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007599839,0.001390821,0.001066081,0.0008918666,0.0005839618,0.001331208,0.002272203,0.001883862,0.002711768],"category_scores_gemma":[0.03536998,0.0007264858,0.001336404,0.0004957762,0.002867395,0.005564086,0.004509371,0.004391959,0.0004302385],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001901266,"about_ca_system_score_gemma":0.000819693,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002248694,"about_ca_topic_score_gemma":0.001353939,"domain_scores_codex":[0.9982773,0.0007747918,0.00007919753,0.0003395945,0.0003699853,0.0001590315],"domain_scores_gemma":[0.9898021,0.006178983,0.0009585062,0.001670659,0.0009851652,0.0004046933],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001375122,0.00006594446,0.002442301,0.0002354233,0.000122262,0.0003075738,0.0002643402,0.5235912,0.003283354,0.4460758,0.002185014,0.02128946],"study_design_scores_gemma":[0.000008639508,0.00004176541,0.0003318472,0.00002841466,0.00001144625,0.00006755155,0.00001832771,0.8780164,0.0004768461,0.1204459,0.000541192,0.00001167852],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04869292,0.0009228216,0.9398533,0.00168622,0.00009381588,0.00005253217,0.0001046587,0.0003927675,0.008201012],"genre_scores_gemma":[0.8704663,0.001534478,0.1150717,0.001296952,0.0004034548,0.0003646893,0.0003707161,0.0003823226,0.01010942],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007599839,"threshold_uncertainty_score":0.04019231,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2113717009","doi":"10.1007/s10107-006-0031-2","title":"Large-scale semidefinite programming via a saddle point Mirror-Prox algorithm","year":2006,"lang":"en","type":"article","venue":"Mathematical Programming","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University","funders":"Office of Naval Research; National Science Foundation","keywords":"Semidefinite programming; Saddle point; Mathematics; Semidefinite embedding; Algorithm; Scale (ratio); Numerical analysis; Mathematical optimization; Positive-definite matrix; Quadratically constrained quadratic program; Quadratic programming; Mathematical analysis; Geometry","authors":[{"name":"Zhaosong Lu","is_ca":true},{"name":"Arkadi Nemirovski","is_ca":false},{"name":"Renato D. C. Monteiro","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01255634044540681,"gpt":0.2442069490326277,"spread":0.2316506085872209,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002607348,0.001404846,0.001473857,0.000524222,0.0005206562,0.001506849,0.001531524,0.001647014,0.004476056],"category_scores_gemma":[0.0080393,0.0007863573,0.0007121467,0.0006276545,0.001521683,0.00222996,0.002833616,0.002668893,0.0009951484],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006376703,"about_ca_system_score_gemma":0.001508172,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007767947,"about_ca_topic_score_gemma":0.001036178,"domain_scores_codex":[0.9992301,0.0004059326,0.00002689401,0.0001124097,0.0001915813,0.00003304334],"domain_scores_gemma":[0.9974359,0.001781186,0.0001694949,0.0002116036,0.0002628843,0.0001390043],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001670884,0.0002179374,0.000336796,0.0002312048,0.00007967126,0.0001695271,0.0001242814,0.5821975,0.004481242,0.3369378,0.007031661,0.06802525],"study_design_scores_gemma":[0.00001389452,0.00002241381,0.00001672735,0.000004149611,0.000003075429,0.00001181402,0.000004374636,0.9690985,0.0002848515,0.0301486,0.0003868418,0.000004786693],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.002489875,0.00003496976,0.9958854,0.0001600281,0.00002083607,0.00002514913,0.00001825717,0.0001063569,0.001259134],"genre_scores_gemma":[0.2805378,0.0002463832,0.7090016,0.0002866638,0.0001041583,0.0005434029,0.0001656863,0.0003908041,0.008723408],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004476056,"threshold_uncertainty_score":0.01497394,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W4391019797","doi":"10.1109/mnet.2024.3355922","title":"(Com)<sup>2</sup>Net: A Novel Communication and Computation Integrated Network Architecture","year":2024,"lang":"en","type":"article","venue":"IEEE Network","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":33,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo; University of Calgary","funders":"National Key Research and Development Program of China; China Postdoctoral Science Foundation; National Natural Science Foundation of China","keywords":"Computer science; Cloud computing; Software deployment; Computation; The Internet; Distributed computing; Domain (mathematical analysis); Artificial intelligence; World Wide Web; Algorithm; Software engineering; Operating system","authors":[{"name":"Weiting Zhang","is_ca":false},{"name":"Dong Yang","is_ca":false},{"name":"Chuan Zhang","is_ca":false},{"name":"Qiang Ye","is_ca":true},{"name":"Hongke Zhang","is_ca":false},{"name":"Xuemin Shen","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01848259349535607,"gpt":0.2557321649710994,"spread":0.2372495714757433,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003677257,0.0003276393,0.0001912507,0.0003375499,0.0006996635,0.001918706,0.001100322,0.0006495936,0.006295567],"category_scores_gemma":[0.0004694368,0.0001809492,0.0002614422,0.0004644275,0.0004482331,0.00189399,0.001079317,0.0007765534,0.002221641],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000791865,"about_ca_system_score_gemma":0.0008580944,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002603495,"about_ca_topic_score_gemma":0.005964404,"domain_scores_codex":[0.9997818,0.00004409466,0.00001272533,0.00004853837,0.0000772382,0.00003560319],"domain_scores_gemma":[0.9997146,0.00005685769,0.00002998299,0.00006771867,0.00008538354,0.00004548333],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006264272,0.0002161906,0.001576262,0.000253708,0.00006545325,0.000610792,0.0002563598,0.06839597,0.03877981,0.3992958,0.1337303,0.3561929],"study_design_scores_gemma":[0.00008429642,0.0002527204,0.0007812322,0.00005886416,0.00006823968,0.000483469,0.00009399373,0.5326741,0.01785603,0.07471503,0.3728701,0.00006185423],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04493507,0.001154877,0.7830666,0.003272626,0.001412288,0.0002423546,0.0009419097,0.01003314,0.1549411],"genre_scores_gemma":[0.4549551,0.001334542,0.4465974,0.001846824,0.0004924501,0.0004020066,0.00298494,0.0005830064,0.09080359],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006295567,"threshold_uncertainty_score":0.02106076,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2971055146","doi":"","title":"Fast Convergence of Natural Gradient Descent for Over-Parameterized Neural Networks","year":2019,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":30,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Initialization; Jacobian matrix and determinant; Gradient descent; Maxima and minima; Parameterized complexity; Convergence (economics); Artificial neural network; Applied mathematics; Mathematics; Computer science; Mathematical optimization; Algorithm; Mathematical analysis; Artificial intelligence","authors":[{"name":"Guodong Zhang","is_ca":false},{"name":"James Martens","is_ca":false},{"name":"Roger Grosse","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03222558805984906,"gpt":0.1798108982464483,"spread":0.1475853101865993,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003564199,0.001005062,0.0009879468,0.0007636375,0.0006050431,0.0008523124,0.001039065,0.001214012,0.001630113],"category_scores_gemma":[0.01458867,0.0006169163,0.0006070875,0.0004297605,0.001539452,0.002012163,0.001732404,0.001779792,0.0002858369],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001526564,"about_ca_system_score_gemma":0.001273321,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003645505,"about_ca_topic_score_gemma":0.005394147,"domain_scores_codex":[0.9990693,0.000468167,0.00004418371,0.0001364005,0.0001922629,0.00008976889],"domain_scores_gemma":[0.9958447,0.002774525,0.0003336585,0.000412721,0.0005141593,0.0001202987],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001078765,0.00003264699,0.001184042,0.0001010995,0.00006542766,0.0001002477,0.00009596254,0.937412,0.002987081,0.03242952,0.0009560287,0.02452808],"study_design_scores_gemma":[0.000002212253,0.00000861596,0.00006485752,0.00000388501,0.000001402591,0.000008502184,0.000003130894,0.9946041,0.0002131758,0.004985891,0.0001022368,0.000002045621],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.037966,0.0003407456,0.9589761,0.0002283254,0.00002536133,0.00004620066,0.00003147293,0.0003707815,0.002015039],"genre_scores_gemma":[0.7549716,0.0003597178,0.2395097,0.0001869718,0.00004274494,0.0002148809,0.0001991123,0.0003314721,0.004183707],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003645505,"threshold_uncertainty_score":0.01884949,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2782985982","doi":"10.1109/icmla.2017.0-166","title":"Anytime Exploitation of Stragglers in Synchronous Stochastic Gradient Descent","year":2017,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":30,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Descent (aeronautics); Stochastic gradient descent; Artificial intelligence; Engineering; Aerospace engineering; Artificial neural network","authors":[{"name":"Nuwan S. Ferdinand","is_ca":true},{"name":"Benjamin Gharachorloo","is_ca":true},{"name":"Stark C. Draper","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02369414696757149,"gpt":0.2663900930483598,"spread":0.2426959460807883,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001337588,0.0009719409,0.001010331,0.0004133203,0.0006108333,0.0007928722,0.001771607,0.0006760731,0.001684676],"category_scores_gemma":[0.003693923,0.0005004463,0.0003866878,0.0005539519,0.001019197,0.001599418,0.001523638,0.001005202,0.0006413538],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006672255,"about_ca_system_score_gemma":0.001877611,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003865652,"about_ca_topic_score_gemma":0.006060528,"domain_scores_codex":[0.9991567,0.0002827472,0.00004792579,0.0001486226,0.0002631596,0.000100985],"domain_scores_gemma":[0.998764,0.0004696136,0.0001498424,0.000328421,0.0001814439,0.0001066351],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004641465,0.0001394513,0.001514534,0.0001179108,0.00008654837,0.0001539153,0.0002509407,0.8081374,0.01241773,0.04347089,0.002992981,0.1302536],"study_design_scores_gemma":[0.00002475828,0.00004275233,0.00007236785,0.000003565337,0.00000602349,0.00001254261,0.000008248781,0.9895723,0.001950387,0.007246399,0.001054381,0.000006186147],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01994384,0.0001577359,0.9770861,0.0001231722,0.00006861676,0.0000279982,0.00002441287,0.001148998,0.001418985],"genre_scores_gemma":[0.6435845,0.000243219,0.3502012,0.0002179513,0.0001049226,0.0001521672,0.0001431152,0.0005381445,0.004814718],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003865652,"threshold_uncertainty_score":0.007686317,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2995434136","doi":"10.48550/arxiv.1905.12558","title":"Limitations of the Empirical Fisher Approximation for Natural Gradient\\n Descent","year":2019,"lang":"","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":30,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of British Columbia","funders":"","keywords":"Fisher information; Hessian matrix; Fisher kernel; Heuristics; Mathematics; Applied mathematics; Econometrics; Mathematical economics; Mathematical optimization; Statistics; Computer science; Artificial intelligence; Kernel method","authors":[{"name":"Frederik Künstner","is_ca":true},{"name":"Lukas Balles","is_ca":false},{"name":"Philipp Hennig","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2954199039827467,"gpt":0.2289787568300307,"spread":0.06644114715271598,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008036,0.0009127085,0.001545374,0.000774933,0.0009248679,0.002202916,0.002986463,0.001911738,0.005089191],"category_scores_gemma":[0.05639027,0.0009035785,0.0006350057,0.0008733316,0.00281831,0.004820098,0.002853913,0.004406353,0.002245564],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001711759,"about_ca_system_score_gemma":0.003147207,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008521223,"about_ca_topic_score_gemma":0.008344332,"domain_scores_codex":[0.9956701,0.002187654,0.0001797032,0.0004486101,0.001324742,0.0001891736],"domain_scores_gemma":[0.9824599,0.01361001,0.0003314855,0.002106299,0.001245496,0.0002467728],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002575175,0.00007128329,0.001224604,0.0003802511,0.00007632338,0.0001149431,0.0002516664,0.2055474,0.0007073301,0.6694352,0.01903802,0.1028955],"study_design_scores_gemma":[0.00002369764,0.00002366534,0.0001766798,0.00008041195,0.000005132976,0.00006678564,0.00002876112,0.7947703,0.0004127332,0.1973376,0.007058755,0.00001547462],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007309853,0.002094635,0.9705346,0.004448213,0.0002742003,0.00005649168,0.0001589834,0.0008505746,0.0142724],"genre_scores_gemma":[0.4152451,0.004171542,0.5582514,0.002158464,0.0006252193,0.000484791,0.0006858023,0.001140672,0.01723701],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.008521223,"threshold_uncertainty_score":0.04249895,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2810910646","doi":"10.1016/j.neucom.2018.06.002","title":"Mini-batch algorithms with Barzilai–Borwein update step","year":2018,"lang":"en","type":"article","venue":"Neurocomputing","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":29,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"National Natural Science Foundation of China","keywords":"Stochastic gradient descent; Computer science; Sequence (biology); Algorithm; Regular polygon; Mathematical optimization; State (computer science); Stochastic optimization; Batch processing; Mathematics; Artificial intelligence","authors":[{"name":"Zhuang Yang","is_ca":false},{"name":"Cheng Wang","is_ca":false},{"name":"Yu Zang","is_ca":false},{"name":"Jonathan Li","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01115320935639728,"gpt":0.2379886590466911,"spread":0.2268354496902938,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00375629,0.002328816,0.002262411,0.0007784687,0.001086035,0.001446794,0.0043435,0.003346932,0.01264562],"category_scores_gemma":[0.01011191,0.001753014,0.001085582,0.001279314,0.00132818,0.002873652,0.0020185,0.004835395,0.008870814],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009121338,"about_ca_system_score_gemma":0.002613498,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005313579,"about_ca_topic_score_gemma":0.009187593,"domain_scores_codex":[0.9987283,0.0004957389,0.0001385825,0.000242242,0.0002993615,0.00009577271],"domain_scores_gemma":[0.9970618,0.001606386,0.0001449377,0.0005168213,0.0005632412,0.0001068092],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001063064,0.0005412856,0.000641337,0.0007410176,0.0003885938,0.0002357856,0.0002508187,0.3709005,0.01154794,0.1405884,0.04683105,0.4262701],"study_design_scores_gemma":[0.0000868011,0.00006241034,0.000130148,0.00002521283,0.00003572274,0.00005490208,0.00001066227,0.9737241,0.003704926,0.01732256,0.004807535,0.00003505754],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001673723,0.0004353972,0.9944379,0.0003249188,0.0002754853,0.00009624624,0.0000943073,0.0009448915,0.001717048],"genre_scores_gemma":[0.05535651,0.0005364076,0.9255182,0.0005601414,0.0004353109,0.0008851452,0.0005222103,0.0008162863,0.01536984],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01264562,"threshold_uncertainty_score":0.04230374,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963002787","doi":"","title":"Improved asynchronous parallel optimization analysis for stochastic incremental methods","year":2018,"lang":"en","type":"article","venue":"HAL (Le Centre pour la Communication Scientifique Directe)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Université de Montréal","funders":"","keywords":"Computer science; Asynchronous communication; Stochastic optimization; Mathematical optimization; Parallel computing; Mathematics","authors":[{"name":"Rémi Leblond","is_ca":false},{"name":"Simon Lacoste-Julien","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01686008516669065,"gpt":0.2740270218591956,"spread":0.257166936692505,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004281871,0.0015441,0.001502233,0.00140596,0.0008576154,0.001634543,0.002465815,0.001343665,0.00797466],"category_scores_gemma":[0.01754861,0.0007100847,0.001260957,0.001276062,0.001756596,0.002587605,0.002830693,0.00311271,0.0009611163],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001753541,"about_ca_system_score_gemma":0.002475916,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005209118,"about_ca_topic_score_gemma":0.006521983,"domain_scores_codex":[0.9981366,0.000737492,0.00008270755,0.0002192837,0.0006580473,0.0001659166],"domain_scores_gemma":[0.9907287,0.006416524,0.0004027241,0.0006638803,0.001470188,0.0003179372],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002581239,0.00009488061,0.0007452742,0.0002503323,0.00008374894,0.0001138897,0.0001240934,0.7044545,0.002500457,0.2436328,0.004642923,0.04309906],"study_design_scores_gemma":[0.000007818179,0.000008108133,0.00004102222,0.000004325847,0.000005901167,0.000004819305,0.000002779592,0.9766889,0.0001990637,0.02265585,0.00037829,0.000003089277],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.006598272,0.000241235,0.9885029,0.0003149507,0.0001293086,0.00003857254,0.00005386639,0.0002179561,0.003902921],"genre_scores_gemma":[0.51377,0.0008253975,0.4636989,0.0004204825,0.0007667493,0.000608066,0.0004090648,0.001206027,0.01829534],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.00797466,"threshold_uncertainty_score":0.02667791,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2894812324","doi":"10.1016/j.disopt.2023.100795","title":"Principled deep neural network training through linear programming","year":2023,"lang":"en","type":"article","venue":"Discrete Optimization","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":25,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Office of Naval Research; Institut de Valorisation des Données; National Science Foundation","keywords":"Computer science; Deep learning; Polyhedron; Artificial intelligence; Artificial neural network; Linear programming; Perspective (graphical); Dependency (UML); Task (project management); Representation (politics); Sample (material); Function (biology); Machine learning; Mathematical optimization; Algorithm; Theoretical computer science; Mathematics; Geometry","authors":[{"name":"Daniel Bienstock","is_ca":false},{"name":"Gonzalo Muñoz","is_ca":false},{"name":"Sebastian Pokutta","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.04017734624734458,"gpt":0.2895398856964629,"spread":0.2493625394491183,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001450398,0.0009229489,0.0009681083,0.0003809315,0.0003972864,0.001003368,0.001503219,0.001423128,0.004876105],"category_scores_gemma":[0.003782729,0.001081147,0.0005469181,0.0005608174,0.001183353,0.00141484,0.002071309,0.002833828,0.0009597789],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000806882,"about_ca_system_score_gemma":0.001462002,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001873661,"about_ca_topic_score_gemma":0.003124789,"domain_scores_codex":[0.9995056,0.0001923573,0.00001979916,0.00008117711,0.0001662712,0.00003480553],"domain_scores_gemma":[0.9989153,0.0007404126,0.00006729219,0.00008408965,0.0001451695,0.00004781233],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006694903,0.00005718154,0.0001845737,0.0001341213,0.00003966111,0.00002795144,0.00004516065,0.8533142,0.001639038,0.06917565,0.003935243,0.07138035],"study_design_scores_gemma":[0.00000374427,0.000005984513,0.00000904125,0.000003761801,0.000001558305,0.000003683279,0.000001097775,0.9927359,0.0002096277,0.006788405,0.0002359003,0.000001321426],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001525642,0.00006342278,0.9969339,0.0001378653,0.00002184199,0.00001727088,0.00002171087,0.0001868987,0.001091348],"genre_scores_gemma":[0.2062439,0.0002811968,0.7820092,0.0003607417,0.0001175602,0.0004440136,0.00018523,0.0005856634,0.009772485],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004876105,"threshold_uncertainty_score":0.01631218,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2963114935","doi":"","title":"Non-Uniform Stochastic Average Gradient Method for Training Conditional Random Fields","year":2015,"lang":"en","type":"article","venue":"ANU Open Research (Australian National University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":25,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Simon Fraser University; University of British Columbia","funders":"","keywords":"Convergence (economics); Computer science; CRFS; Sampling (signal processing); Algorithm; Sampling scheme; Conditional random field; Stochastic gradient descent; Mathematical optimization; Rate of convergence; Mathematics; Artificial intelligence; Estimator; Statistics; Artificial neural network; Key (lock)","authors":[{"name":"Mark Schmidt","is_ca":true},{"name":"Reza Babanezhad","is_ca":true},{"name":"Mohamed Osama Ahmed","is_ca":true},{"name":"Aaron Defazio","is_ca":false},{"name":"Ann Clifton","is_ca":true},{"name":"Anoop Sarkar","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.2458712651436055,"gpt":0.4074290261833877,"spread":0.1615577610397822,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003804185,0.001313615,0.001856468,0.001333996,0.0008419959,0.0009189178,0.002957554,0.002002198,0.00416176],"category_scores_gemma":[0.01025037,0.001081025,0.001085919,0.001551979,0.001182104,0.002136381,0.00125343,0.002992438,0.001848636],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001579491,"about_ca_system_score_gemma":0.002095805,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00836732,"about_ca_topic_score_gemma":0.01213163,"domain_scores_codex":[0.9982561,0.000957105,0.00007897563,0.0003288875,0.0002757814,0.0001031617],"domain_scores_gemma":[0.995804,0.003016756,0.000176876,0.0004146592,0.0004777101,0.0001100876],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001760404,0.0001324001,0.0008559514,0.0001363472,0.00008458272,0.00008870154,0.0001165552,0.7649332,0.002787996,0.02751845,0.005744583,0.1974252],"study_design_scores_gemma":[0.000008611673,0.00001247165,0.00003566037,0.000004373654,0.000002888235,0.0000094308,0.000003150201,0.9936713,0.0003895044,0.005320758,0.0005372839,0.000004537925],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002182105,0.00008540294,0.9961487,0.00006866379,0.00002285038,0.00004695377,0.00004115541,0.001107536,0.0002966778],"genre_scores_gemma":[0.1110181,0.0001466736,0.8848451,0.0002379114,0.00007353469,0.0004214539,0.000644881,0.0005918771,0.002020347],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00836732,"threshold_uncertainty_score":0.02011871,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2894591993","doi":"10.1109/allerton.2018.8635903","title":"Anytime Stochastic Gradient Descent: A Time to Hear from all the Workers","year":2018,"lang":"en","type":"article","venue":"","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Computer science; Stochastic gradient descent; Exploit; Computation; Convergence (economics); Node (physics); Distributed computing; Focus (optics); Acceleration; Algorithm; Artificial intelligence; Computer security; Artificial neural network","authors":[{"name":"Nuwan S. Ferdinand","is_ca":true},{"name":"Stark C. Draper","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01617655381045896,"gpt":0.2389224668351279,"spread":0.2227459130246689,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001816224,0.001321577,0.001150753,0.0003062793,0.0009356523,0.00119441,0.002540033,0.001403942,0.004492874],"category_scores_gemma":[0.004944245,0.0006554533,0.0006113254,0.0006041888,0.001310198,0.002040142,0.002149488,0.002249399,0.001773329],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007497811,"about_ca_system_score_gemma":0.002960403,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004010564,"about_ca_topic_score_gemma":0.006841982,"domain_scores_codex":[0.9987828,0.0003535681,0.00004206253,0.0002321072,0.0004423851,0.0001469969],"domain_scores_gemma":[0.9984781,0.0005867955,0.0001295218,0.0003830847,0.0002572544,0.0001653323],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009217019,0.0002566745,0.001671626,0.0002765328,0.0001916867,0.000348802,0.0005864569,0.5559015,0.01805611,0.06391136,0.01628314,0.3415945],"study_design_scores_gemma":[0.00007610363,0.00008256025,0.000126752,0.00001265185,0.00002155739,0.00004052409,0.00005233335,0.971939,0.00326054,0.01875929,0.005614943,0.00001380671],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004599798,0.0001687672,0.9919892,0.0003886161,0.0001012458,0.00003280561,0.00001412249,0.0008941859,0.001811365],"genre_scores_gemma":[0.2366932,0.0003488484,0.7516721,0.0005665037,0.0002355127,0.0002346795,0.0001475601,0.0005719744,0.009529571],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004492874,"threshold_uncertainty_score":0.01503021,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3196800830","doi":"10.1007/s10915-021-01628-3","title":"Stochastic Gradient Descent with Polyak’s Learning Rate","year":2021,"lang":"en","type":"article","venue":"Journal of Scientific Computing","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"McGill University","funders":"Air Force Office of Scientific Research; Fundação para a Ciência e a Tecnologia; Institut de Valorisation des Données","keywords":"Stochastic gradient descent; Subgradient method; Mathematics; Constant (computer programming); Rate of convergence; Generalization; Gradient descent; Regular polygon; Descent (aeronautics); Applied mathematics; Convex function; Mathematical optimization; Convergence (economics); Artificial neural network; Mathematical analysis; Computer science; Artificial intelligence; Geometry","authors":[{"name":"Mariana Prazeres","is_ca":true},{"name":"Adam M. Oberman","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01466382442135339,"gpt":0.2337888838771633,"spread":0.21912505945581,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004457125,0.001404714,0.002531295,0.0009726255,0.0009689097,0.002096703,0.002681911,0.004016095,0.005822189],"category_scores_gemma":[0.01775575,0.001357208,0.001206758,0.00152592,0.001843152,0.003186196,0.002520799,0.004929794,0.003126704],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001185536,"about_ca_system_score_gemma":0.002860553,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003825305,"about_ca_topic_score_gemma":0.003119466,"domain_scores_codex":[0.9978283,0.001065576,0.0001422545,0.0003105087,0.0005164719,0.0001368599],"domain_scores_gemma":[0.9936028,0.003856198,0.0002998501,0.0007070451,0.001277598,0.000256415],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001884997,0.0001840335,0.0003536572,0.0002129706,0.0001234368,0.00008196337,0.00004965113,0.7631475,0.002028821,0.1365839,0.009800442,0.08724492],"study_design_scores_gemma":[0.00001367146,0.00001537088,0.00002262577,0.000006784127,0.000005085482,0.000009709346,0.000001290511,0.9903327,0.0002377647,0.008746474,0.0006020517,0.000006556791],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002635799,0.0003001251,0.9943995,0.0003566178,0.0002571082,0.00003256825,0.0000276438,0.0003037663,0.001686979],"genre_scores_gemma":[0.2044246,0.0008636338,0.7715771,0.0006329553,0.0006290096,0.00048606,0.0003018343,0.0008549441,0.02022994],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005822189,"threshold_uncertainty_score":0.02357185,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3080910898","doi":"10.48550/arxiv.2008.10898","title":"PAGE: A Simple and Optimal Probabilistic Gradient Estimator for Nonconvex Optimization","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Simple (philosophy); Estimator; Probabilistic logic; Mathematical optimization; Applied mathematics; Mathematics; Computer science; Algorithm; Artificial intelligence; Statistics","authors":[{"name":"Zhize Li","is_ca":false},{"name":"Hongyan Bao","is_ca":true},{"name":"Xiangliang Zhang","is_ca":true},{"name":"Peter Richtárik","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.07104277370489873,"gpt":0.2059147819171644,"spread":0.1348720082122656,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002786431,0.001821609,0.00241676,0.0007351507,0.0005673414,0.00158565,0.002807813,0.002053068,0.003722547],"category_scores_gemma":[0.01268249,0.001144743,0.000965892,0.0008591712,0.001709657,0.003132776,0.002487594,0.003520426,0.00180299],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009223849,"about_ca_system_score_gemma":0.002843503,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002559687,"about_ca_topic_score_gemma":0.003170655,"domain_scores_codex":[0.9982467,0.0007282736,0.00007524826,0.0002919738,0.0005126,0.0001453005],"domain_scores_gemma":[0.9969991,0.001786706,0.0002009726,0.00034661,0.0005104077,0.0001562021],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002947648,0.0001704033,0.001319778,0.0004791271,0.0001857635,0.0001675708,0.00007099604,0.7191588,0.005219581,0.08457777,0.01450778,0.1738478],"study_design_scores_gemma":[0.00002404781,0.00003201001,0.00006893391,0.00001295025,0.000008232282,0.00003112967,0.000003691337,0.9877144,0.0007068454,0.01015381,0.001230645,0.00001336485],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001331222,0.0002561188,0.9970267,0.0001525934,0.00005585744,0.0000464776,0.0000348783,0.0005007456,0.0005953864],"genre_scores_gemma":[0.1598867,0.0009614016,0.8314437,0.0008298928,0.0003020928,0.0005879924,0.0005547954,0.0007748823,0.004658615],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003722547,"threshold_uncertainty_score":0.01473624,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2994062025","doi":"10.1109/tac.2020.3045094","title":"Continuous-Time Discounted Mirror Descent Dynamics in Monotone Concave Games","year":2020,"lang":"en","type":"article","venue":"IEEE Transactions on Automatic Control","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Toronto","funders":"","keywords":"Monotone polygon; Monotonic function; Regular polygon; Dynamics (music); Descent (aeronautics); Type (biology); Gradient descent; Legendre polynomials","authors":[],"retraction":null,"screen_n_in":null,"score":{"opus":0.0100666719676093,"gpt":0.2288216826494433,"spread":0.218755010681834,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005623952,0.0006045711,0.0005368085,0.0002456811,0.0003519073,0.001069404,0.0007679504,0.0007237424,0.002807415],"category_scores_gemma":[0.002674627,0.000228325,0.0004369069,0.000154927,0.001007756,0.00118636,0.0007790108,0.0008718291,0.0002739227],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0012185,"about_ca_system_score_gemma":0.0007763266,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002825892,"about_ca_topic_score_gemma":0.001766793,"domain_scores_codex":[0.9997726,0.00008663456,0.00001046853,0.00004176393,0.00004508034,0.00004345301],"domain_scores_gemma":[0.9994978,0.0002107386,0.00007600521,0.00004192434,0.00008386263,0.00008964207],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001512328,0.00009079975,0.0009256867,0.00009334048,0.00003885263,0.0003111557,0.0002486049,0.3268514,0.01028792,0.6437746,0.001542484,0.01568387],"study_design_scores_gemma":[0.00001397281,0.00004492611,0.0001136928,0.000006939275,0.000004767462,0.00003461765,0.00002660812,0.9430988,0.0006998889,0.05524303,0.0007030803,0.000009748121],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2005152,0.0002067691,0.7782522,0.0005891068,0.00008441169,0.00009601984,0.0001109221,0.0001990238,0.01994629],"genre_scores_gemma":[0.9677793,0.0001256106,0.02582677,0.00007450612,0.00001325628,0.00006994717,0.00003308895,0.0000251249,0.006052436],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002825892,"threshold_uncertainty_score":0.009391725,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3171596153","doi":"10.1109/jsac.2021.3087272","title":"LOSP: Overlap Synchronization Parallel With Local Compensation for Fast Distributed Training","year":2021,"lang":"en","type":"article","venue":"IEEE Journal on Selected Areas in Communications","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"University of Waterloo","funders":"National Key Research and Development Program of China; Research Grants Council, University Grants Committee; China Postdoctoral Science Foundation; Impact Fund; Science, Technology and Innovation Commission of Shenzhen Municipality; National Natural Science Foundation of China","keywords":"Computer science; Scalability; Synchronization (alternating current); Computation; Speedup; Distributed computing; Overhead (engineering); Convergence (economics); Stochastic gradient descent; Rate of convergence; Compensation (psychology); Data synchronization; Mathematical optimization; Parallel computing; Algorithm; Key (lock); Computer network; Artificial intelligence; Artificial neural network","authors":[{"name":"Haozhao Wang","is_ca":false},{"name":"Zhihao Qu","is_ca":false},{"name":"Song Guo","is_ca":false},{"name":"Ningqi Wang","is_ca":false},{"name":"Ruixuan Li","is_ca":false},{"name":"Weihua Zhuang","is_ca":true}],"retraction":null,"screen_n_in":null,"score":{"opus":0.03917666790837083,"gpt":0.2856775653390298,"spread":0.246500897430659,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001122499,0.0009177732,0.001135864,0.0003555401,0.0005884733,0.0005875189,0.001815226,0.000765622,0.0024227],"category_scores_gemma":[0.002440562,0.0004259979,0.0004561743,0.0005839373,0.0006978395,0.001334504,0.002022063,0.00132865,0.0008170732],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004609751,"about_ca_system_score_gemma":0.002208167,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003956833,"about_ca_topic_score_gemma":0.005111638,"domain_scores_codex":[0.9993016,0.0001603212,0.00004309014,0.0001817567,0.000217668,0.00009562547],"domain_scores_gemma":[0.9991668,0.0002910636,0.00008847619,0.000222126,0.0001432753,0.00008814083],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007896101,0.0003208776,0.002073382,0.0002218239,0.00009843415,0.0002355515,0.0002829713,0.5344444,0.01943559,0.01228613,0.01097003,0.4188412],"study_design_scores_gemma":[0.00005733607,0.0000759518,0.000168674,0.000004554687,0.000007845612,0.00003037879,0.0000155264,0.9941133,0.002391105,0.001885017,0.001243509,0.000006783695],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01516369,0.0001783649,0.9809994,0.00015159,0.00007492608,0.00005253585,0.00003211939,0.002210141,0.001137267],"genre_scores_gemma":[0.600266,0.0002264024,0.3926405,0.0003085647,0.0001543953,0.000357829,0.000363808,0.0004627568,0.005219696],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003956833,"threshold_uncertainty_score":0.008104682,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W3036623140","doi":"10.1007/s10957-023-02297-y","title":"Unified Analysis of Stochastic Gradient Methods for Composite Convex and Smooth Optimization","year":2023,"lang":"en","type":"article","venue":"Journal of Optimization Theory and Applications","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":false,"routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false},"ca_institutions":"","funders":"Global Collaborative Research, King Abdullah University of Science and Technology; Institut de Valorisation des Données; King Abdullah University of Science and Technology","keywords":"Mathematics; Convexity; Stochastic gradient descent; Convex function; Theory of computation; Convergence (economics); Mathematical optimization; Convex optimization; Applied mathematics; Variance (accounting); Regular polygon; Algorithm; Computer science; Artificial intelligence; Artificial neural network","authors":[{"name":"Ahmed Khaled","is_ca":false},{"name":"Othmane Sebbouh","is_ca":false},{"name":"Nicolas Loizou","is_ca":false},{"name":"Robert M. Gower","is_ca":false},{"name":"Peter Richtárik","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.01997888666737985,"gpt":0.3296915564201645,"spread":0.3097126697527846,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008879001,0.002826458,0.002778375,0.002937664,0.0008404596,0.00300105,0.002789921,0.002733356,0.005259505],"category_scores_gemma":[0.01927802,0.001426168,0.002956223,0.001875227,0.003095834,0.004769214,0.004945625,0.004733302,0.0008127665],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002079378,"about_ca_system_score_gemma":0.003193746,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00349099,"about_ca_topic_score_gemma":0.004157033,"domain_scores_codex":[0.9972636,0.001394599,0.0001268832,0.0002376402,0.0008018175,0.0001755467],"domain_scores_gemma":[0.9920351,0.005151645,0.0004591999,0.000399808,0.001566905,0.0003872944],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00006773246,0.00007000272,0.0002855125,0.0002501375,0.0001217401,0.00008100996,0.0001015531,0.2405746,0.001395775,0.7370613,0.00281642,0.01717418],"study_design_scores_gemma":[0.000005647581,0.00002057967,0.00006623532,0.00001661008,0.00001399157,0.0000132943,0.000008334176,0.9338043,0.0001702926,0.06500157,0.0008682424,0.00001093271],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001740936,0.0005263142,0.9950891,0.0002270786,0.00009075893,0.0000276811,0.00002245355,0.00004255944,0.002233182],"genre_scores_gemma":[0.2808957,0.003884999,0.6830576,0.0006694229,0.001394712,0.0008065276,0.0004813067,0.001104034,0.02770573],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008879001,"threshold_uncertainty_score":0.04695725,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null},{"id":"W2896830491","doi":"10.1287/ijoo.2022.0072","title":"A Subsampling Line-Search Method with Second-Order Results","year":2022,"lang":"en","type":"article","venue":"INFORMS Journal on Optimization","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false},"ca_institutions":"Polytechnique Montréal","funders":"Agence Nationale de la Recherche","keywords":"Line search; Computer science; Context (archaeology); Mathematical optimization; Function (biology); Sample (material); Line (geometry); Saddle point; Reduction (mathematics); Algorithm; Artificial intelligence; Mathematics; Path (computing)","authors":[{"name":"El Houcine Bergou","is_ca":false},{"name":"Youssef Diouane","is_ca":true},{"name":"Vladimír Kunc","is_ca":false},{"name":"Vyacheslav Kungurtsev","is_ca":false},{"name":"Clément W. Royer","is_ca":false}],"retraction":null,"screen_n_in":null,"score":{"opus":0.02840894031896267,"gpt":0.2941041273880469,"spread":0.2656951870690842,"validation_status":"score_only:v0-immature-baseline"},"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002347247,0.00112469,0.001137018,0.0009287834,0.0005150403,0.001125961,0.001203203,0.001604489,0.003177663],"category_scores_gemma":[0.006634558,0.0006224446,0.0008605046,0.000706848,0.001103,0.001270535,0.001338206,0.00175978,0.001164197],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00109975,"about_ca_system_score_gemma":0.001563837,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003632594,"about_ca_topic_score_gemma":0.004181474,"domain_scores_codex":[0.999208,0.0003389903,0.00003525558,0.000111849,0.0002502048,0.00005567489],"domain_scores_gemma":[0.9981914,0.001027127,0.0001600615,0.0001962952,0.0003342819,0.00009090255],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001704909,0.0001175618,0.0008634294,0.0001603269,0.00007200995,0.0001458213,0.0001680783,0.7917305,0.008617181,0.1049404,0.004020668,0.08899349],"study_design_scores_gemma":[0.000005560347,0.00002850134,0.00003260632,0.000006095117,0.000002977699,0.00001389306,0.000003452909,0.9945169,0.0005722034,0.004054116,0.0007593222,0.000004492757],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003175703,0.0001029735,0.995566,0.00008814288,0.0000214376,0.00002964735,0.00001789755,0.0002174433,0.0007807413],"genre_scores_gemma":[0.1610742,0.0002102097,0.832938,0.0002840849,0.00007121479,0.0003383293,0.0002023141,0.0004137115,0.004467866],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003632594,"threshold_uncertainty_score":0.01241356,"prediction_status":"machine_predicted_unvalidated"},"labels":[],"label_agreement":null}]}