Applied Results
SFT & RLFT
The strongest proof page in the repo: Qwen2.5-Math-1.5B on gsm8k with measured gains.
- Load gsm8k train and test sets.
- Evaluate Qwen2.5-Math-1.5B zero-shot behavior.
- Run supervised fine-tuning for answer-format alignment.
- Run reinforcement fine-tuning to improve reward-shaped reasoning behavior.