Mind Lab Toolkit (MinT)
实践案例

实践案例:dapo-aime

Cookbook 页面 dapo-aime 演示在 DAPO-Math-17k 上用 **direct GRPO(无 SFT warm-start)**训练数学推理能力,AIME 2024 作为主评测,AIME 2025 / 2026 作辅助 eval。

配方参数

算法direct GRPO,不做 SFT warm-start
底座Qwen/Qwen3-4B-Instruct-2507
训练数据BytedTsinghua-SIA/DAPO-Math-17k,本地物化到 data/train/full.jsonl
主评测AIME 2024(data/eval/aime2024.jsonl
辅助评测AIME 2025 / AIME 2026(manifest 与主评测同一行合约提供)
Primary metricseval_accuracyeval_greedy_accuracyeval_pass_at_k

为什么用 direct GRPO

数学题的奖励可程序化——不需要训练奖励模型。GRPO 的核心思路是同 prompt 多次采样、组内归一化奖励;这正好对应 MinT 里"奖励 / 验证器 / 环境反馈"对应到 GRPO Recipe(loss_fn='importance_sampling')的路径。

Lifecycle 顺序

uv sync --dry-run --eval-only 训练

与 chat-dpo 同款:先装依赖、干跑数据通路、跑一遍基线 eval,再正式训练。细粒度可执行命令 Cookbook 指向上游 README。

在 MinT 上的对应

选择 GRPO Recipe 后,MinT 会走 loss_fn='importance_sampling' 路径。面板推荐超参 rank=32 / 5 轮 / lr=1e-4 / bs=8。控制台调通的流程可以迁移到 Python 脚本。

企业版差异

  • 把底座升到 Qwen/Qwen3-30B-A3B-Instruct-2507Qwen/Qwen3-4B-Thinking-2507(推理 / 思维链变体,见支持的模型)。
  • MoE 模型平均单次完整微调耗时约 1 至 1.5 小时(30B 模型,A3B 结构,)。
  • 训练完成保存检查点:每个检查点带上元数据(Recipe、数据版本、超参、评测分),方便回溯。

相关

RL 与 GRPO 算法本身见 RLHF / GRPO;想看 DPO 例子见 chat-dpo

本页目录