Mind Lab Toolkit (MinT)
开始使用

支持的模型

MinT 支持的底座矩阵分三类:Qwen3 基础模型(社区版与企业版同样可用)、企业版专属商业模型(GLM / Kimi / DeepSeek)、技术兼容的同代开源家族

Qwen3 基础模型(社区版 + 企业版)

模型 ID推荐场景
Qwen/Qwen3-0.6B冒烟测试、快速迭代(quickstart 默认)
Qwen/Qwen3-4B-Instruct-2507Cookbook 配方(dapo-aime、chat-dpo 等)、中等规模对话
Qwen/Qwen3-4B-Thinking-25074B 量级推理 / 思维链任务
Qwen/Qwen3-30B-A3B-Instruct-2507中大规模对话与指令微调(MoE)
Qwen/Qwen3-235B-A22B-Instruct-2507大规模指令微调

企业版专属商业模型

下列模型的合规授权随企业版一并交付,社区版不可用:

  • GLM-5
  • GLM-5.1
  • Kimi-K2
  • Kimi-K2.5
  • DeepSeek-V3

技术兼容的同代家族

下列开源家族在架构上与已支持模型同代,可按需接入:

  • Qwen2.5、Qwen3(Instruct / Thinking / Coder 变体)
  • Llama 3.x 家族
  • Gemma 2.x 与 3.x
  • DeepSeek 家族

官网的完整"敬请期待"矩阵

产品官网 macaron.im/zh/mindlab/mint 声明支持 "6 个模型家族、27 个模型变体",其中包含大量"敬请期待"项。企业采购前如需确认具体交付时间,请联系销售。

如何选型

  • 没有特别偏好? 用 lineup 里任意一个跑 smoke run 即可。
  • 跑通流程 / 快速迭代Qwen/Qwen3-0.6B
  • 做 cookbook 或中等规模对话Qwen/Qwen3-4B-Instruct-2507
  • 需要推理 / 思维链Qwen/Qwen3-4B-Thinking-2507
  • 常规业务(客服 / 知识问答 / 文档摘要)Qwen/Qwen3-30B-A3B-Instruct-2507—— 指出 "平均单次完整微调耗时约 1 至 1.5 小时(30B 模型,A3B 结构)"。
  • 企业已采购 GLM / Kimi / DeepSeek 授权:直接选对应企业版专属模型。

切换底座

MinT 的一贯口径是"换底座只需要改一个字符串":

training_client = service.create_lora_training_client(
    base_model="Qwen/Qwen3-30B-A3B-Instruct-2507",
    rank=16,
)

脚本级切换也支持通过环境变量 MINT_BASE_MODEL(用于兼容 MINT_BASE_MODEL-aware 的 recipe,见文档站)。

说明

可用模型清单最终以企业租户合同授权范围为准。如需在合同外接入新的底座或"敬请期待"型号,请联系销售 sales@mindlab.ltd

本页目录