LLM from Scratch
架构
SFT 与 RLFT
基准
文档
EN
GitHub
结果展示
SFT 与 RLFT
仓库里最强的结果展示页:Qwen2.5-Math-1.5B 在 gsm8k 上的微调与强化学习结果。
1.56%
零样本基线
62.9%
SFT 后准确率
100%
格式遵循率
准备 gsm8k 训练集与测试集。
评估 Qwen2.5-Math-1.5B 的零样本表现。
运行监督微调以稳定答案格式。
运行强化学习微调以提升奖励驱动的推理表现。