AI Architecture & Systems

Advanced GEMM Pipelining and Scheduling

2.5.1Double/Multi-Buffering and Software Pipelining#

2.5.2Asynchronous Copy and Producer–Consumer Synchronization#

2.5.3Warp Specialization and Role Assignment#

2.5.4Persistent Kernel and Persistent GEMM#

2.5.5Split-K, Stream-K, and Work Distribution#

2.5.6CTA Swizzle, Cluster, and Locality#

2.5.7Occupancy, Register Pressure, and Wave Quantization#