Skip to content

training-llms-megatron

from Orchestra-Research/AI-research-SKILLs

Trains large language models (2B-462B parameters) using NVIDIA Megatron-Core with advanced parallelism strategies. Use when training models >1B parameters, need maximum GPU efficiency (47% MFU on H100

v1.0.0MIT
367
Lines
1,262
Words
22
Code Blocks

Languages

bash
08-distributed-training/megatron-core/SKILL.md