AI Architecture & Systems

Expert Parallelism

5.10.1Expert Placement, Replication, and Sharding#

5.10.2Token Dispatch, All-to-All, and Combine#

5.10.3Combining Expert Parallelism with Tensor Parallelism#

5.10.4Expert Load Balance and Hot Experts#

5.10.5Dropless Routing and Capacity Management#

5.10.6Cross-Node MoE Communication and Topology-Aware Deployment#