AI Architecture & Systems

MoE Kernels

2.12.1Router, Top-k Gating, and Token Assignment#

2.12.2Token Permutation and Unpermutation#

2.12.3Grouped GEMM and Expert Padding#

2.12.4Dropless MoE and Block-Sparse GEMM#

2.12.5Dispatch/Combine and Communication Fusion#

2.12.6Shared Experts, Routed Experts, and Compute Overlap#