{"id":"W1544532352","doi":"10.48550/arxiv.1301.3583","title":"Big Neural Networks Waste Capacity","year":2013,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Neural Networks and Applications","field":"Computer Science","cited_by":49,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Leverage (statistics); Artificial neural network; Deep neural networks; Computer science; Parametrization (atmospheric modeling); Generalization; Gradient descent; Artificial intelligence; Generalization error; Mathematical optimization; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006450464,0.001707464,0.001926151,0.001206543,0.0009564994,0.00263712,0.00261082,0.002023214,0.005946558],"category_scores_gemma":[0.03860551,0.001017334,0.001238099,0.001183178,0.003859484,0.008987527,0.004646942,0.005178828,0.001645047],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00163179,"about_ca_system_score_gemma":0.001203609,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002111416,"about_ca_topic_score_gemma":0.002424513,"domain_scores_codex":[0.9977119,0.0008453096,0.0001593833,0.0004794011,0.000544114,0.0002598903],"domain_scores_gemma":[0.9845169,0.00928683,0.0006065686,0.003885963,0.00115148,0.0005522814],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006774515,0.0001642719,0.003620218,0.0006265853,0.0003857158,0.0004742422,0.0003575885,0.527253,0.005751305,0.230817,0.02700778,0.2028649],"study_design_scores_gemma":[0.00005684269,0.0001575543,0.0007782526,0.0001527953,0.00007501418,0.0001874488,0.0000500788,0.5769337,0.004349978,0.4067823,0.01043355,0.00004255502],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.139818,0.009434296,0.7818623,0.02641655,0.001802701,0.0001337021,0.001190411,0.005107518,0.03423462],"genre_scores_gemma":[0.9085359,0.003200211,0.06938329,0.004433309,0.001078122,0.0002206598,0.0006392783,0.001155935,0.01135335],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006450464,"threshold_uncertainty_score":0.03411371,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08645081458260345,"score_gpt":0.1739940902281608,"score_spread":0.08754327564555733,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}