{"id":"W3123224975","doi":"","title":"When does preconditioning help or hurt generalization","year":2021,"lang":"en","type":"article","venue":"Institutional Repositories DataBase (IRDB)","topic":"Stochastic Gradient Optimization Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Generalization; Reproducing kernel Hilbert space; Computer science; Matching (statistics); Kernel (algebra); Population; Variance (accounting); Algorithm; Applied mathematics; Hilbert space; Mathematical optimization; Mathematics; Statistics; Discrete mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.008216715,0.0007362559,0.001339998,0.000402365,0.0005654689,0.001515221,0.0007964836,0.002506445,0.002984306],"category_scores_gemma":[0.05620421,0.000435901,0.0007148464,0.0005050316,0.001821638,0.004676815,0.001520603,0.001950527,0.00150025],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004544753,"about_ca_system_score_gemma":0.001232188,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001599463,"about_ca_topic_score_gemma":0.002384744,"domain_scores_codex":[0.9973974,0.001253629,0.0001835854,0.000515983,0.0004039713,0.000245338],"domain_scores_gemma":[0.9824507,0.01113929,0.001122772,0.003691706,0.001095417,0.0005001753],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001303227,0.0004065502,0.01823638,0.001271876,0.0004179242,0.0004011724,0.0009853464,0.2807476,0.03442247,0.0749833,0.02808327,0.558741],"study_design_scores_gemma":[0.0002467552,0.0007502419,0.009504808,0.0006129811,0.000177755,0.0004615367,0.0005866729,0.7720402,0.0261311,0.1756454,0.01374123,0.0001011774],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3196872,0.006187672,0.6253064,0.02631806,0.0009797137,0.0001871401,0.0005960074,0.004315864,0.01642197],"genre_scores_gemma":[0.7969509,0.002473308,0.1930321,0.002751652,0.0005707763,0.0001385395,0.0003526833,0.001233791,0.002496253],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008216715,"threshold_uncertainty_score":0.04345465,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02050156646347252,"score_gpt":0.2614843825587116,"score_spread":0.2409828160952391,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}