{"id":"W6979299583","doi":"","title":"CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs","year":2025,"lang":"en","type":"article","venue":"ArXiv.org","topic":"Software Engineering Research","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba","funders":"","keywords":"Code (set theory); Data compression; Coding (social sciences); Focus (optics); Lossy compression; Context (archaeology); Code generation; Encoder; Compression (physics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009806971,0.001953766,0.0006518948,0.001042519,0.0003970437,0.0008731622,0.002007163,0.001086697,0.007086511],"category_scores_gemma":[0.009469768,0.0004469374,0.000611553,0.0008371319,0.0007527876,0.002613497,0.002072049,0.001997325,0.004497739],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005476808,"about_ca_system_score_gemma":0.001591863,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002226194,"about_ca_topic_score_gemma":0.004121112,"domain_scores_codex":[0.9991853,0.0001879929,0.0000568689,0.000252731,0.0002319703,0.00008528391],"domain_scores_gemma":[0.9967076,0.001676377,0.0001886097,0.000816371,0.0004466592,0.0001644459],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001411687,0.0005205884,0.004036524,0.001130413,0.00007551403,0.000481359,0.0007160603,0.02746705,0.08218472,0.004760969,0.05200391,0.8252112],"study_design_scores_gemma":[0.0003667561,0.001045761,0.002894233,0.0001043037,0.00008330408,0.0005954863,0.0002814924,0.7627737,0.1820251,0.01204368,0.03765796,0.000128226],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.09400637,0.001337451,0.6531565,0.0006559733,0.0003986572,0.0006322322,0.003274116,0.2421464,0.004392191],"genre_scores_gemma":[0.3559025,0.0005540679,0.6146848,0.0007246566,0.0001465161,0.001136407,0.0101777,0.007729995,0.008943269],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007086511,"threshold_uncertainty_score":0.02370673,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06280035122035256,"score_gpt":0.3020367164221885,"score_spread":0.2392363652018359,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}