{"id":"W4386065782","doi":"10.1109/cvpr52729.2023.01935","title":"Simulated Annealing in Early Layers Leads to Better Generalization","year":2023,"lang":"en","type":"article","venue":"","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada; Compute Canada","keywords":"Initialization; Computer science; Artificial intelligence; Margin (machine learning); Gradient descent; Benchmark (surveying); Stochastic gradient descent; Machine learning; Transfer of learning; Generalization; Forgetting; Overfitting; Simulated annealing; Matching (statistics); Algorithm; Artificial neural network; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002523179,0.0000668131,0.00007165906,0.0002920137,0.00005531741,0.0001398319,0.0002412337,0.00003576433,0.00002961001],"category_scores_gemma":[0.00004094746,0.00006632999,0.00002018232,0.001487171,0.00000561688,0.0002816239,0.00008500423,0.00006523677,0.0006902675],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002393749,"about_ca_system_score_gemma":0.00001388233,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008664068,"about_ca_topic_score_gemma":0.00002806322,"domain_scores_codex":[0.9991775,0.00005062672,0.000155689,0.0002265849,0.0001690434,0.0002205671],"domain_scores_gemma":[0.9996603,0.00004393829,0.00002235193,0.0001702208,0.00003582636,0.00006736443],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000003644975,0.000008075108,0.03568655,0.000003502741,0.000003426085,0.00002378074,0.004208765,0.9305766,0.00459201,0.009486615,0.001711838,0.01369524],"study_design_scores_gemma":[0.0002213188,0.00002333011,0.05926629,0.000008236613,4.984464e-7,4.22774e-7,0.00004041015,0.9357771,0.00058792,0.0002732485,0.003682629,0.0001186234],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6173565,0.0000024129,0.3787958,0.001862631,0.0001215725,0.00007000079,1.381984e-7,0.0003138212,0.001477066],"genre_scores_gemma":[0.9804734,0.000001408456,0.0146342,0.003034794,0.00002809045,0.000003220335,0.000005225833,0.000008057764,0.001811614],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3641616,"threshold_uncertainty_score":0.8872222,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02811438426582509,"score_gpt":0.2791647282253171,"score_spread":0.251050343959492,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}