Publication / conference / published / eacl26 / 2026

PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference

Krishna Teja Chitty-Venkata, Jie Ye, Siddhisanket Raskar, Xian-He Sun, Anthony Kougkas, Murali Emani, Venkatram Vishwanath, Bogdan Nicolae

Findings of the Association for Computational Linguistics (EACL 2026) · Association for Computational Linguistics

Citation

@inproceedings{chittyvenkata2026pagedeviction,
  grc_key = {chittyvenkata2026pagedeviction},
  grc_slug = {chitty-venkata-2026-pagedeviction-3f8a},
  author = {Chitty-Venkata, Krishna Teja and Ye, Jie and Raskar, Siddhisanket and Sun, Xian-He and Kougkas, Anthony and Emani, Murali and Vishwanath, Venkatram and Nicolae, Bogdan},
  title = {{PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference}},
  booktitle = {Findings of the Association for Computational Linguistics (EACL 2026)},
  year = {2026},
  month = mar,
  publisher = {Association for Computational Linguistics},
  pages = {3207--3218},
  publication_status = {published},
  doi = {10.18653/v1/2026.findings-eacl.168},
  url = {https://doi.org/10.18653/v1/2026.findings-eacl.168},
  source_url = {https://aclanthology.org/2026.findings-eacl.168.pdf},
  keywords = {KV Cache, Compression, LLM Inference Serving},
}