Decoder-only Transformer • PyTorch • From Scratch

LLM from Scratch

Build, train, benchmark, and fine-tune a modern language model from first principles.

RoPERMSNormSwiGLUFlash Attention 2DDPSFTRLFT
1.56% -> 62.9% Zero-shot accuracy on gsm8k
18.9% -> 100% Format compliance
Tokenizer / Training / Parallel / Kernel Implemented stack