跳转至

模型

Macaron 托管 API 服务 Macaron-V1 模型家族。所有变体基于 Mixture-of-LoRA(MoL)架构: 冻结基座模型加一组小型专家 LoRA 适配器,路由器在每个用户轮次选择一个专家。架构与路由 循环见什么是 Macaron

托管阵容

模型 ID 总参数 基座 专家 用途
macaron-v1-venti 748B 744B GLM-5.2(冻结) 4 × 1B LoRA(L0 Chat, L1 Agent, L2 Coding, L3 GenUI) 旗舰;通过路由覆盖对话、智能体、编码、GenUI
macaron-v1-tall 50B Qwen3.6-35B-A3B(冻结) 4 × 1B LoRA(相同四专家设计) 本地 / 低延迟部署
macaron-v1-coding-venti 748B 744B GLM-5.2 coding LoRA 合入基座(单专家) 编码专精;无路由开销
glm-5.2 744B GLM-5.2 无(仅基座) 无 MoL 专家的基座模型

路由

两个 MoL 服务变体(macaron-v1-ventimacaron-v1-tall)通过三阶段循环路由每个用户 轮次:路由(L0 在 24 token 预算下将请求分类到一个专家)、回答(被选专家响应)、 摘要(专家输出 ≤192 token 摘要存于服务端作为共享上下文)。macaron-v1-coding-ventiglm-5.2 跳过路由:coding LoRA 合入基座,glm-5.2 仅为基座。

定价

定价随模型更新动态调整。当前费率请自行在 dashboard 查看:中国大陆站(mintcn.macaron.xin,人民币计价)或国际站(mint.macaron.im,美元计价)。

自部署基座模型

以上阵容为托管 Macaron 家族。若你自部署 MinT 并在自己的端点上服务 Qwen3 社区基座模型, Qwen3 阵容见自部署模型参考。两个接口不同:托管 API 通过 /v1/chat/completions 服务 Macaron 模型;自部署接口通过 /oai/api/v1 服务 Qwen3 基座 模型。