-
Notifications
You must be signed in to change notification settings - Fork 4.5k
All issues
Issue creation is restricted in this repository
Issues
is:issue state:open
is:issue state:open
Search results
[BUG] MFSDP v2 with HybridEP: intermittent bad gradients in eager training
bugSomething isn't workingSomething isn't workingStatus: Open.[Bug] Fine-grained activation offloading: the inline reload in
tensor_popraces its own D2H, corrupting the warmup iterationbugSomething isn't workingSomething isn't workingStatus: Open.#7398 In NVIDIA/Megatron-LM;- Status: Open.#7389 In NVIDIA/Megatron-LM;
[ENHANCEMENT] Shared-prefix training with context parallelism for exact agent trajectories
enhancementNew feature or requestNew feature or requestStatus: Open.#7386 In NVIDIA/Megatron-LM;- Status: Open.#7340 In NVIDIA/Megatron-LM;
Make training initialization and runtime services consume configs
enhancementNew feature or requestNew feature or requestStatus: Open.Separate configuration preparation from runtime initialization
enhancementNew feature or requestNew feature or requestStatus: Open.[Bug][MCore dev 0e6ac576] Intermittent CUDA runtime failures in DeepSeek-V4-0731 fused CSA/DSA with packed THD + CP32 on SM90
bugSomething isn't workingSomething isn't workingwaiting-on-customerWaiting on the original author to respondWaiting on the original author to respondStatus: Open.#7292 In NVIDIA/Megatron-LM;[ENHANCEMENT] Reduce torch_dist checkpoint preparation overhead for prepended-axis tensors
enhancementNew feature or requestNew feature or requestStatus: Open.#7275 In NVIDIA/Megatron-LM;Move PEFT model components into Megatron Core
enhancementNew feature or requestNew feature or requestStatus: Open.Add adapter-only checkpointing to Megatron-LM
enhancementNew feature or requestNew feature or requestStatus: Open.