Mind Lab Toolkit (MinT)
使用 MinT

OpenAI 兼容 API

MinT 上的训练产物可以一键挂载到推理服务,得到一个 OpenAI 兼容的 Endpoint。业务系统切换 base URL 即可接入。

两种调用形态

同一个 LoRA 权重可以通过两种方式调用:

  • SDK 直采样:通过 sampling_client.sample(prompt, sampling_params, num_samples),用于灰度对比、自动评测、A / B 上线等场景。
  • OpenAI 兼容 HTTP: 描述"训练得到的 LoRA 权重可以一键挂载到推理服务,得到一个 OpenAI 兼容的 Endpoint"。业务侧只需切换 base URL 即可用 OpenAI SDK 调用。

SDK 直采样

训练完成后从 training_client 拿到 sampling client:

sampling_client = training_client.save_weights_and_get_sampling_client(name='my-run-v1')

prompt_ids = tokenizer.encode('3 * 7 =')
samples = sampling_client.sample(
    prompt=types.ModelInput.from_ints(prompt_ids),
    sampling_params=types.SamplingParams(max_tokens=16, temperature=0.7),
    num_samples=4,
)
for s in samples.sequences:
    print(tokenizer.decode(s.tokens))

OpenAI 兼容 HTTP

明确训练完的模型会得到一个 OpenAI 兼容 Endpoint。具体的 base URL、模型标识、认证方式在训练完成后由 sampling_client 提供,或通过控制台查看。业务系统按 OpenAI SDK 的标准用法即可接入:

from openai import OpenAI

client = OpenAI(
    base_url="<your-mint-oai-compatible-endpoint>",
    api_key="sk-your-api-key-here",
)
resp = client.chat.completions.create(
    model="my-run-v1",     # 训练时使用的 name
    messages=[{"role": "user", "content": "3 * 7 ="}],
    max_tokens=16,
    temperature=0.7,
)
print(resp.choices[0].message.content)

部署模式与推理适配

列出两种部署模式,选择会影响推理形态:

  • LoRA 在线挂载:与基础模型共享显存,启动时间最快,适合多实验并行采样。
  • LoRA 合并部署:把 LoRA 合并进底座生成完整权重,导出后可单独离线部署,适合私有化交付场景。

获取端点信息

企业版租户的 OpenAI 兼容 Endpoint 地址与鉴权凭据由 Mind Lab 团队随集群交付时提供;save_weights_and_get_sampling_client 返回的对象内也可以查询到当前 Endpoint 元信息。

本页目录