
New Method Combines Model and Prompt Compression for Faster LLMs
Researchers propose a novel approach merging model pruning and prompt compression to reduce LLM size and latency. The method adapts to different prompts and decoding steps for dynamic efficiency.