Actions: vasunvidia/TransformerEngine
Actions
Showing runs from all workflows
24 workflow runs
24 workflow runs
Fix the race in the dbias computation in MXFP8 quantization and group…
Deploy nightly docs
#81:
Commit 5d947a0
pushed
by
vasunvidia
Fix zero input shape for bgrad_group_quantize (#2854)
Deploy nightly docs
#80:
Commit a30a126
pushed
by
vasunvidia
Enable fused RMSNorm dLN + add through CUDNN (#2778)
Deploy nightly docs
#79:
Commit 8477d3d
pushed
by
vasunvidia
[PyT] Install pytest in onnx L1 test as Pyt container no longer packa…
Deploy nightly docs
#78:
Commit b7598aa
pushed
by
vasunvidia
Fix deploy nightly docs issue (#2636)
Deploy nightly docs
#77:
Commit 3846bf7
pushed
by
vasunvidia
[PyTorch] Fix cross_entropy_forward stride guard for non-contiguous i…
Deploy nightly docs
#76:
Commit e6d97ff
pushed
by
vasunvidia
Add fast_set_attr to modules not inheriting from base.py (#2724)
Deploy nightly docs
#75:
Commit c68ec31
pushed
by
vasunvidia
[PyT] Plumbing correct bias dims from TE to cudnn, while adding suppo…
Deploy nightly docs
#74:
Commit 2d0d276
pushed
by
vasunvidia
Enable env. var to disable Fused split quantize
Deploy nightly docs
#73:
Commit a526679
pushed
by
vasunvidia
[PyT] Plumbing correct bias dims from TE to cudnn, while adding suppo…
Deploy nightly docs
#72:
Commit 2d0d276
pushed
by
vasunvidia
[PyTorch] Python
GroupedTensor (#2654)
Deploy nightly docs
#71:
Commit ac81c85
pushed
by
vasunvidia
[PyTorch] Fix garbage initialized permuted_scale (#2547)
Deploy nightly docs
#70:
Commit c988548
pushed
by
vasunvidia
Enable capturable mode for optimizer if store_param_remainders is pas…
Deploy nightly docs
#69:
Commit e86a8c9
pushed
by
vasunvidia
[PyTorch] Fix garbage initialized permuted_scale (#2547)
Deploy nightly docs
#68:
Commit c988548
pushed
by
vasunvidia
[PyTorch] fix
test_current_device test (#2398)
Deploy nightly docs
#67:
Commit 41fb9bc
pushed
by
vasunvidia
Change to print softmax correction factor
Deploy nightly docs
#66:
Commit 73eb7c6
pushed
by
vasunvidia
[PyTorch] fix
test_current_device test (#2398)
Deploy nightly docs
#65:
Commit 41fb9bc
pushed
by
vasunvidia
[JAX] Remove import jax.extend.ffi (#2193)
Deploy nightly docs
#64:
Commit 57b4d7b
pushed
by
vasunvidia
Fix bug when enabling --overlap-grad-reduce in mcore (#2142)
Deploy nightly docs
#63:
Commit 11e9d66
pushed
by
vasunvidia
Dropout with 8-bit RNG (#2014)
Deploy nightly docs
#62:
Commit e0e3d12
pushed
by
vasunvidia
[PyTorch][MOE] Tentative Fix For Replacing from_blob with empty for e…
Deploy nightly docs
#61:
Commit c449c6c
pushed
by
vasunvidia
[PyTorch Debug] Skip log test on device if it does not support fp8. (…
Deploy nightly docs
#60:
Commit 1398fa5
pushed
by
vasunvidia
[JAX] Fix for TE GEMM - Always AllGather RHS non-contracting dims wit…
Deploy nightly docs
#59:
Commit 3fc1e4b
pushed
by
vasunvidia
[PyTorch] Refactor C++ quantizer infrastructure (#1952)
Deploy nightly docs
#58:
Commit cb5013b
pushed
by
vasunvidia