{"id":"W2604117713","doi":"10.48550/arxiv.1703.11008","title":"Computing Nonvacuous Generalization Bounds for Deep (Stochastic) Neural Networks with Many More Parameters than Training Data","year":2017,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":250,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Overfitting; Generalization; Computer science; Artificial neural network; Maxima and minima; Regularization (linguistics); Early stopping; Artificial intelligence; Machine learning; Algorithm; Test data; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01145587,0.001828886,0.001579056,0.002202265,0.00105034,0.002462153,0.002633324,0.002480003,0.002722981],"category_scores_gemma":[0.08398829,0.001168568,0.001496202,0.001320153,0.006268711,0.008552341,0.005881782,0.007948782,0.0003464324],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004360782,"about_ca_system_score_gemma":0.001347206,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002470871,"about_ca_topic_score_gemma":0.002477351,"domain_scores_codex":[0.9951122,0.001853143,0.0002858731,0.001043815,0.001379805,0.0003251307],"domain_scores_gemma":[0.9325429,0.05809937,0.002377602,0.004693414,0.00143202,0.0008546971],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001458156,0.00006536584,0.002126064,0.0002388442,0.0001090237,0.0001187832,0.0002660317,0.596624,0.001860554,0.367309,0.001743474,0.02939308],"study_design_scores_gemma":[0.000005217831,0.00001980566,0.0002687967,0.00003920639,0.000007178782,0.00001924714,0.00001090148,0.7362145,0.0007545153,0.2622915,0.000357279,0.00001181908],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04942261,0.001855358,0.9402331,0.002048878,0.0001050014,0.00004286568,0.0001741458,0.0005440397,0.00557399],"genre_scores_gemma":[0.808029,0.001369499,0.1840615,0.001443496,0.0002608486,0.0003596781,0.0004876245,0.0006800176,0.003308282],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01145587,"threshold_uncertainty_score":0.0605852,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1449076541886231,"score_gpt":0.237001323538144,"score_spread":0.09209366934952087,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}