Large scale 4D parallelism pre-training for 🤗 transformers in Mixture of Experts *(still work in progress)*
transformersmoedata-parallelismdistributed-optimizersmodel-parallelismmegatronmixture-of-expertspipeline-parallelismhuggingface-transformersmegatron-lmtensor-parallelismlarge-scale-language-modeling3d-parallelismzero-1sequence-parallelism
-
Updated
Dec 14, 2023 - Python