使用 MinT
开始训练
数据处理完成后,进入训练模块。MinT 企业版提供面板化的训练任务配置,也允许通过 SDK 脚本提交相同的任务。所有训练任务都以 LoRA 微调为核心。
新建训练任务
在训练页面点击「新建训练」,进入任务配置流程。

新建训练任务
选择 Recipe
根据你拥有的数据类型选择对应的 Recipe:
| 你有这些数据… | 用 | MinT 调用 |
|---|---|---|
| 有标注的 prompt → response | SFT | loss_fn="cross_entropy" |
| chosen / rejected 偏好对 | DPO | forward_backward_custom + 自定义 preference loss |
| reward / verifier / 环境反馈 | RL (GRPO) | loss_fn="importance_sampling" |
若同时拥有监督数据与 reward,推荐先做 SFT 再做 RL。

选择 Recipe
选择训练数据集
从数据资源中挑选用于本次训练的数据集,可同时选择多个并配置混合比例。

选择训练数据集
配置训练参数
进入训练参数页:rank(LoRA 秩)、训练轮数、学习率、批大小是最常用的四个杠杆。面板会在选定 Recipe 后给出推荐默认值(rank=32 / 5 轮 / lr=1e-4 / bs=8)。

配置训练参数
启动训练与监控
点击「开始训练」并等待任务完成。控制台实时展示损失曲线、评测指标和资源占用。

启动训练,实时监控
查看用量和保存检查点
训练结束后,在用量页查看本次训练消耗,并保存当前模型检查点用于部署或后续 RL 阶段。每个检查点都会带上元数据(Recipe、数据版本、超参、评测分),方便回溯。

查看用量,保存模型检查点
下一步
检查点保存后,前往LoRA 部署与检查点了解在线挂载与合并部署两种形态。