开始使用
支持的模型
MinT 支持的底座矩阵分三类:Qwen3 基础模型(社区版与企业版同样可用)、企业版专属商业模型(GLM / Kimi / DeepSeek)、技术兼容的同代开源家族。
Qwen3 基础模型(社区版 + 企业版)
| 模型 ID | 推荐场景 |
|---|---|
Qwen/Qwen3-0.6B | 冒烟测试、快速迭代(quickstart 默认) |
Qwen/Qwen3-4B-Instruct-2507 | Cookbook 配方(dapo-aime、chat-dpo 等)、中等规模对话 |
Qwen/Qwen3-4B-Thinking-2507 | 4B 量级推理 / 思维链任务 |
Qwen/Qwen3-30B-A3B-Instruct-2507 | 中大规模对话与指令微调(MoE) |
Qwen/Qwen3-235B-A22B-Instruct-2507 | 大规模指令微调 |
企业版专属商业模型
下列模型的合规授权随企业版一并交付,社区版不可用:
GLM-5GLM-5.1Kimi-K2Kimi-K2.5DeepSeek-V3
技术兼容的同代家族
下列开源家族在架构上与已支持模型同代,可按需接入:
- Qwen2.5、Qwen3(Instruct / Thinking / Coder 变体)
- Llama 3.x 家族
- Gemma 2.x 与 3.x
- DeepSeek 家族
官网的完整"敬请期待"矩阵
产品官网 macaron.im/zh/mindlab/mint 声明支持 "6 个模型家族、27 个模型变体",其中包含大量"敬请期待"项。企业采购前如需确认具体交付时间,请联系销售。
如何选型
- 没有特别偏好? 用 lineup 里任意一个跑 smoke run 即可。
- 跑通流程 / 快速迭代:
Qwen/Qwen3-0.6B。 - 做 cookbook 或中等规模对话:
Qwen/Qwen3-4B-Instruct-2507。 - 需要推理 / 思维链:
Qwen/Qwen3-4B-Thinking-2507。 - 常规业务(客服 / 知识问答 / 文档摘要):
Qwen/Qwen3-30B-A3B-Instruct-2507—— 指出 "平均单次完整微调耗时约 1 至 1.5 小时(30B 模型,A3B 结构)"。 - 企业已采购 GLM / Kimi / DeepSeek 授权:直接选对应企业版专属模型。
切换底座
MinT 的一贯口径是"换底座只需要改一个字符串":
training_client = service.create_lora_training_client(
base_model="Qwen/Qwen3-30B-A3B-Instruct-2507",
rank=16,
)脚本级切换也支持通过环境变量 MINT_BASE_MODEL(用于兼容 MINT_BASE_MODEL-aware 的 recipe,见文档站)。
说明
可用模型清单最终以企业租户合同授权范围为准。如需在合同外接入新的底座或"敬请期待"型号,请联系销售 sales@mindlab.ltd。