{"id":"W4408925909","doi":"10.1145/3676641.3716009","title":"PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System","year":2025,"lang":"en","type":"article","venue":"","topic":"Parallel Computing and Optimization Techniques","field":"Computer Science","cited_by":20,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Toronto","funders":"Universitas Brawijaya","keywords":"Computer science; Parallel computing; Parallelism (grammar); Decoding methods; Computer architecture; Programming language; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006342829,0.000994098,0.0005933063,0.000447988,0.0006994558,0.001321162,0.001914274,0.0005950547,0.004129287],"category_scores_gemma":[0.002765146,0.0004644018,0.0005549804,0.0007595182,0.0005985436,0.002195726,0.001754445,0.001490309,0.002149531],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008578896,"about_ca_system_score_gemma":0.00215313,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004316192,"about_ca_topic_score_gemma":0.006363513,"domain_scores_codex":[0.9995029,0.000108904,0.00003093718,0.0001656631,0.0001193974,0.00007210168],"domain_scores_gemma":[0.9992521,0.0002603357,0.00004201761,0.0002652957,0.0001215261,0.00005870491],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00146065,0.0006278782,0.00450824,0.000484346,0.0002467028,0.0009257818,0.0007164935,0.1997624,0.07275569,0.05038686,0.05851996,0.609605],"study_design_scores_gemma":[0.00005164683,0.0001148989,0.0002222291,0.00001148921,0.00002801524,0.00009496977,0.00004055499,0.954646,0.01966921,0.01697104,0.008127427,0.00002250575],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05705737,0.0007744668,0.8833019,0.0008466755,0.0003054367,0.000179797,0.0006221917,0.04287746,0.01403469],"genre_scores_gemma":[0.4619378,0.0003018995,0.5261005,0.0005098559,0.0001236865,0.0002868437,0.001533379,0.001353984,0.007852],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004316192,"threshold_uncertainty_score":0.01381385,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.00812880525198429,"score_gpt":0.2625035649182994,"score_spread":0.2543747596663151,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}