Mind Lab Toolkit (MinT)
使用 MinT

数据处理

数据质量决定训练上限。MinT 企业版数据处理模块面向「原始语料 → 训练样本 → 评测样本」的全链路,提供辅助模型配置、原始数据加工、Rubric 评分表构建等能力。

2.1 配置辅助模型

基于现有模型训练最佳实践,提供的原始数据集往往很难符合训练的需求,都需要使用最为先进的模型对于数据集进行清洗和增写。Mind Lab 提供自部署的先进模型(GLM5.2、DeepSeek-v4、GPT-5.5 等)作为数据加工辅助模型;如需使用请联系销售:sales@mindlab.ltd,或在「模型配置」页面接入自有 API。

配置辅助模型页面

图 2.1 — 配置辅助模型

2.2 处理原始数据集

工作流分五步:上传数据 → 选择加工模型 → 设置生成规模 → 预览样本 → 构建数据集。

上传数据集

上传本地准备好的、待清洗的原始数据集,支持三种上传格式。

上传原始数据集

图 2.2a — 上传原始数据集(支持三种格式)

选择加工模型与系统提示词

选择数据加工的模型,输入数据加工倾向即系统提示词(System Prompt)。

选择数据加工模型和系统提示词

图 2.2b — 选择加工模型,输入系统提示词

设置数据集名称和生成规模

选择数据集名称和数据集生成规模,控制每条原始数据扩展的样本量。

设置数据集名称和生成规模

图 2.2c — 设置数据集名称和生成规模

预览样本

在构建数据集之前完成观察样本的生成情况,如果不满意,需要修改模型和系统提示词,重新生成;确认满意后再触发全量构建。

预览样本

图 2.2d — 预览样本

构建数据集

点击「构建数据集」,按照所选规模构建适当的量级的数据集。

构建数据集

图 2.2e — 构建数据集

2.3 构建 Rubric

Rubric 评分表用于在评测阶段把「答得对不对」量化为可比较的分数。根据构建的数据集,生成评测的 Judge 评分表,后续训练的模型会依据这个评分表进行评分。

构建Rubric评分表

图 2.3 — 构建 Rubric 评分表

注意

Rubric 一旦冻结,建议在整个项目里保持不变;若中途需要升级评分尺子,请同时记录升级前后的分数对照,避免因「换尺成本」造成数据失真。

下一步

数据处理完成后,前往开始训练新建训练任务。

本页目录