Pure PyTorch + 🤗 Transformers reimplementation of Megalodon (CEMA + chunked attention) - readable, hackable, no CUDA kernels required
pytorchropeemapytorch-implementationlinear-attentionefficient-transformersllmsub-quadratic-attentionlong-context-modelingstreaming-inferencecomplex-ema
-
Updated
Jan 12, 2026 - Python