数据处理
数据质量决定训练上限。MinT 企业版数据处理模块面向「原始语料 → 训练样本 → 评测样本」的全链路,提供辅助模型配置、原始数据加工、Rubric 评分表构建等能力。
2.1 配置辅助模型
基于现有模型训练最佳实践,提供的原始数据集往往很难符合训练的需求,都需要使用最为先进的模型对于数据集进行清洗和增写。Mind Lab 提供自部署的先进模型(GLM5.2、DeepSeek-v4、GPT-5.5 等)作为数据加工辅助模型;如需使用请联系销售:sales@mindlab.ltd,或在「模型配置」页面接入自有 API。

图 2.1 — 配置辅助模型
2.2 处理原始数据集
工作流分五步:上传数据 → 选择加工模型 → 设置生成规模 → 预览样本 → 构建数据集。
上传数据集
上传本地准备好的、待清洗的原始数据集,支持三种上传格式。

图 2.2a — 上传原始数据集(支持三种格式)
选择加工模型与系统提示词
选择数据加工的模型,输入数据加工倾向即系统提示词(System Prompt)。

图 2.2b — 选择加工模型,输入系统提示词
设置数据集名称和生成规模
选择数据集名称和数据集生成规模,控制每条原始数据扩展的样本量。

图 2.2c — 设置数据集名称和生成规模
预览样本
在构建数据集之前完成观察样本的生成情况,如果不满意,需要修改模型和系统提示词,重新生成;确认满意后再触发全量构建。

图 2.2d — 预览样本
构建数据集
点击「构建数据集」,按照所选规模构建适当的量级的数据集。

图 2.2e — 构建数据集
2.3 构建 Rubric
Rubric 评分表用于在评测阶段把「答得对不对」量化为可比较的分数。根据构建的数据集,生成评测的 Judge 评分表,后续训练的模型会依据这个评分表进行评分。

图 2.3 — 构建 Rubric 评分表
注意
Rubric 一旦冻结,建议在整个项目里保持不变;若中途需要升级评分尺子,请同时记录升级前后的分数对照,避免因「换尺成本」造成数据失真。
下一步
数据处理完成后,前往开始训练新建训练任务。