{"id":"W4417248049","doi":"10.48550/arxiv.2504.06949","title":"Adaptive Computation Pruning for the Forgetting Transformer","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Advanced Neural Network Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada","keywords":"Softmax function; Forgetting; Computation; Pruning; FLOPS; Transformer; Context (archaeology); Set (abstract data type)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0002370607,0.0002399628,0.0002223719,0.0000699525,0.000507086,0.00008203297,0.001212661,0.0001283558,0.000001115413],"category_scores_gemma":[0.00004562655,0.000194593,0.0001701654,0.0003401016,0.00005528024,0.0002194601,0.0004198901,0.000503982,0.000009471198],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007881302,"about_ca_system_score_gemma":0.0001317964,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001351068,"about_ca_topic_score_gemma":0.00001511814,"domain_scores_codex":[0.998489,0.00004273756,0.000342185,0.0006390456,0.000162356,0.0003247058],"domain_scores_gemma":[0.9978729,0.001033226,0.0002366967,0.0006346962,0.0001773109,0.00004517972],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003165497,0.00007716745,0.003519751,0.0001948758,0.0002322112,0.000002019905,0.002653577,0.5323006,0.0004517149,0.06773637,0.002212203,0.3905878],"study_design_scores_gemma":[0.0002859596,0.00003788453,0.006135926,0.0001752731,0.00006173251,0.000002131748,0.00008234633,0.9528119,0.00145301,0.03084543,0.007751692,0.0003566999],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005148752,0.0003726909,0.9865332,0.00468976,0.000602471,0.001638765,0.00001734442,0.0002708809,0.0007261997],"genre_scores_gemma":[0.8160504,0.00007387003,0.180947,0.0009246354,0.0002714516,0.001133479,0.00003307435,0.00002115071,0.0005449739],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8109016,"threshold_uncertainty_score":0.7935271,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07684360389762872,"score_gpt":0.3255755501200715,"score_spread":0.2487319462224428,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}