Simulated Multi-GPU inference engine implementing Megatron-style Tensor Parallelism, GPipe Pipeline Parallelism, and KV Cache Sharding from scratch. Features bit-identical fidelity validation on Qwen2-0.5B weights and analytical communication cost modeling.
distributed-systemshpcdistributed-computingpytorchscalingmulti-gpuinference-optimizationgpipepipeline-parallelismkv-cachemegatron-lmtensor-parallelismllmqwen2torch-distributed
-
Updated
Jul 29, 2026 - Python