Abhimanyu's Notes

Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM

References