{"id":"W4415968362","doi":"10.1109/lca.2025.3630094","title":"Disaggregated Speculative Decoding for Carbon-Efficient LLM Serving","year":2025,"lang":"","type":"article","venue":"IEEE Computer Architecture Letters","topic":"Advanced Neural Network Applications","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Decoding methods; Security token; Cache; Workload; Overhead (engineering); Latency (audio); Sequential decoding; Decoupling (probability)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0007375073,0.001261411,0.0008409615,0.0004870872,0.000775762,0.00171322,0.002037428,0.0009096006,0.00341321],"category_scores_gemma":[0.004516592,0.0004567496,0.0006099473,0.0007513296,0.0008887046,0.002838444,0.002484303,0.00166623,0.001583228],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001250673,"about_ca_system_score_gemma":0.003178133,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009407122,"about_ca_topic_score_gemma":0.02451561,"domain_scores_codex":[0.9991989,0.000196726,0.0000500571,0.0001459237,0.0002402789,0.0001681881],"domain_scores_gemma":[0.9984806,0.0005870783,0.00006840879,0.0005096513,0.0002599048,0.00009426343],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001001408,0.0004639119,0.009387128,0.0003775053,0.0001438348,0.0007477215,0.001063033,0.5356972,0.0654344,0.0311012,0.03906949,0.3155133],"study_design_scores_gemma":[0.00002237984,0.0000501338,0.0001414079,0.00000715231,0.00001290329,0.00004392819,0.00008483206,0.9791686,0.007638505,0.009165198,0.003649513,0.00001536709],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2303946,0.002001385,0.7121049,0.001610632,0.0003876315,0.0001930523,0.001490683,0.03748498,0.01433215],"genre_scores_gemma":[0.8006071,0.0003441078,0.1891828,0.0006223932,0.00006769568,0.0001453662,0.001919797,0.00227628,0.004834522],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009407122,"threshold_uncertainty_score":0.01870477,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01334071655782341,"score_gpt":0.2646251550038536,"score_spread":0.2512844384460302,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}