结果展示

SFT 与 RLFT

仓库里最强的结果展示页:Qwen2.5-Math-1.5B 在 gsm8k 上的微调与强化学习结果。

1.56% 零样本基线
62.9% SFT 后准确率
100% 格式遵循率
  1. 准备 gsm8k 训练集与测试集。
  2. 评估 Qwen2.5-Math-1.5B 的零样本表现。
  3. 运行监督微调以稳定答案格式。
  4. 运行强化学习微调以提升奖励驱动的推理表现。