模型¶
Macaron 托管 API 服务 Macaron-V1 模型家族。所有变体基于 Mixture-of-LoRA(MoL)架构: 冻结基座模型加一组小型专家 LoRA 适配器,路由器在每个用户轮次选择一个专家。架构与路由 循环见什么是 Macaron。
托管阵容¶
| 模型 ID | 总参数 | 基座 | 专家 | 用途 |
|---|---|---|---|---|
macaron-v1-venti |
748B | 744B GLM-5.2(冻结) | 4 × 1B LoRA(L0 Chat, L1 Agent, L2 Coding, L3 GenUI) | 旗舰;通过路由覆盖对话、智能体、编码、GenUI |
macaron-v1-tall |
50B | Qwen3.6-35B-A3B(冻结) | 4 × 1B LoRA(相同四专家设计) | 本地 / 低延迟部署 |
macaron-v1-coding-venti |
748B | 744B GLM-5.2 | coding LoRA 合入基座(单专家) | 编码专精;无路由开销 |
glm-5.2 |
744B | GLM-5.2 | 无(仅基座) | 无 MoL 专家的基座模型 |
路由¶
两个 MoL 服务变体(macaron-v1-venti、macaron-v1-tall)通过三阶段循环路由每个用户
轮次:路由(L0 在 24 token 预算下将请求分类到一个专家)、回答(被选专家响应)、
摘要(专家输出 ≤192 token 摘要存于服务端作为共享上下文)。macaron-v1-coding-venti
与 glm-5.2 跳过路由:coding LoRA 合入基座,glm-5.2 仅为基座。
定价¶
定价随模型更新动态调整。当前费率请自行在 dashboard 查看:中国大陆站(mintcn.macaron.xin,人民币计价)或国际站(mint.macaron.im,美元计价)。
自部署基座模型¶
以上阵容为托管 Macaron 家族。若你自部署 MinT 并在自己的端点上服务 Qwen3 社区基座模型,
Qwen3 阵容见自部署模型参考。两个接口不同:托管 API 通过
/v1/chat/completions 服务 Macaron 模型;自部署接口通过 /oai/api/v1 服务 Qwen3 基座
模型。