AI Architecture & Systems

Communication-Efficient Learning and Distributed Optimization

6.26.1Local SGD and Periodic Parameter Averaging#

6.26.2Gradient Quantization, Sparsification, and Error Feedback#

6.26.3Low-Rank Gradient Compression and PowerSGD#

6.26.4Asynchronous Training, Staleness, and Convergence#

6.26.5Low-Bandwidth Distributed Pretraining and DiLoCo#

6.26.6Federated Learning, Secure Aggregation, and Differential Privacy#

6.26.7Communication Budget, Statistical Efficiency, and Wall-Clock Training Time#