PromptHub

KV Cache

Quick Definition

Memory optimization storing key-values for faster generation

Full Definition

A memory optimization storing computed key-value pairs to avoid redundant attention computation.

Examples

inference optimization, generation speedup, memory management

Related Terms

attention-mechanism inference-optimization

More Large Language Models Terms