Publication / conference / published / eacl26 / 2026
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
Findings of the Association for Computational Linguistics (EACL 2026) · Association for Computational Linguistics
Citation
@inproceedings{chittyvenkata2026pagedeviction,
grc_key = {chittyvenkata2026pagedeviction},
grc_slug = {chitty-venkata-2026-pagedeviction-3f8a},
author = {Chitty-Venkata, Krishna Teja and Ye, Jie and Raskar, Siddhisanket and Sun, Xian-He and Kougkas, Anthony and Emani, Murali and Vishwanath, Venkatram and Nicolae, Bogdan},
title = {{PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference}},
booktitle = {Findings of the Association for Computational Linguistics (EACL 2026)},
year = {2026},
month = mar,
publisher = {Association for Computational Linguistics},
pages = {3207--3218},
publication_status = {published},
doi = {10.18653/v1/2026.findings-eacl.168},
url = {https://doi.org/10.18653/v1/2026.findings-eacl.168},
source_url = {https://aclanthology.org/2026.findings-eacl.168.pdf},
keywords = {KV Cache, Compression, LLM Inference Serving},
}