AI Architecture & Systems
1
Microarchitecture
2
Kernel
3
Compiler
4
Architecture
5
System
6
Algorithms
Algorithms
/
§6.6
MHA, MQA, GQA, and MLA
6.6.1
Multi-Head Attention (MHA)
#
6.6.2
Multi-Query Attention (MQA)
#
6.6.3
Grouped-Query Attention (GQA)
#
6.6.4
Multi-Head Latent Attention (MLA)
#
6.6.5
Head Sharing, Latent Compression, and Cache Capacity
#
6.6.6
KV Cache and Incremental Autoregressive Inference
#
6.6.7
Quality, Bandwidth, and Parallelism Trade-offs Among Attention Variants
#
← Previous
6.5 The Basic Mechanism of Attention
→ Next
6.7 Position Encoding and Context Extension