AI Architecture & Systems

From Naive GEMM to Tiled GEMM

2.3.1Naive GEMM and Loop Reordering#

2.3.2CPU Cache Blocking and SIMD Microkernel#

2.3.3GPU Global-Memory GEMM#

2.3.4Shared-Memory Tiling and Register Blocking#

2.3.5Compute Reuse, Memory Coalescing, and Write-Back Optimization#

2.3.6Correctness Checking and Step-by-Step Performance Analysis#