{"id":"W2959756691","doi":"10.48550/arxiv.1907.04164","title":"Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Quadratic equation; Artificial neural network; Stochastic gradient descent; Gradient descent; Computer science; Acceleration; Batch processing; Simple (philosophy); Momentum (technical analysis); Mathematical optimization; Algorithm; Mathematics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005268182,0.0006447564,0.0007760079,0.0003547367,0.0005508061,0.001107569,0.0009726412,0.0011995,0.00293334],"category_scores_gemma":[0.04291511,0.0005122601,0.0003529367,0.0003120078,0.001859949,0.003504389,0.001017026,0.00257169,0.0004922314],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007679434,"about_ca_system_score_gemma":0.001143335,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003170678,"about_ca_topic_score_gemma":0.003798983,"domain_scores_codex":[0.9982417,0.000935445,0.00005719891,0.0003207597,0.0003097829,0.000135104],"domain_scores_gemma":[0.9854168,0.0108939,0.001048427,0.001385922,0.0008034591,0.0004513929],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001052843,0.0004008792,0.008950504,0.0004984702,0.0001015942,0.0003301084,0.0005638967,0.7489333,0.01913864,0.1633594,0.01225899,0.04441144],"study_design_scores_gemma":[0.00006877107,0.00007977127,0.001109797,0.00003231514,0.0000131904,0.0000371878,0.00005594077,0.9224889,0.002965491,0.07234327,0.000786446,0.00001888184],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.348467,0.001023403,0.6326784,0.005674765,0.0002281485,0.0001058433,0.0003657067,0.0009416862,0.01051504],"genre_scores_gemma":[0.9304345,0.0003376676,0.06677295,0.0004165897,0.00008170747,0.00009389336,0.0001781757,0.0002293425,0.001455062],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005268182,"threshold_uncertainty_score":0.02786118,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03901067719968814,"score_gpt":0.1875669450614755,"score_spread":0.1485562678617874,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}