PromptHub
Large Language Models Featured 26 views

Flash Attention

Quick Definition

Memory-efficient attention using GPU SRAM block computation

Full Definition

An optimized attention algorithm computing in GPU SRAM blocks for reduced memory and increased speed.

Examples

fast training, memory optimization, transformer acceleration

Related Terms

attention-mechanism gpu-optimization

More Large Language Models Terms