使用 MinT
OpenAI 兼容 API
MinT 上的训练产物可以一键挂载到推理服务,得到一个 OpenAI 兼容的 Endpoint。业务系统切换 base URL 即可接入。
两种调用形态
同一个 LoRA 权重可以通过两种方式调用:
- SDK 直采样:通过
sampling_client.sample(prompt, sampling_params, num_samples),用于灰度对比、自动评测、A / B 上线等场景。 - OpenAI 兼容 HTTP: 描述"训练得到的 LoRA 权重可以一键挂载到推理服务,得到一个 OpenAI 兼容的 Endpoint"。业务侧只需切换 base URL 即可用 OpenAI SDK 调用。
SDK 直采样
训练完成后从 training_client 拿到 sampling client:
sampling_client = training_client.save_weights_and_get_sampling_client(name='my-run-v1')
prompt_ids = tokenizer.encode('3 * 7 =')
samples = sampling_client.sample(
prompt=types.ModelInput.from_ints(prompt_ids),
sampling_params=types.SamplingParams(max_tokens=16, temperature=0.7),
num_samples=4,
)
for s in samples.sequences:
print(tokenizer.decode(s.tokens))OpenAI 兼容 HTTP
明确训练完的模型会得到一个 OpenAI 兼容 Endpoint。具体的 base URL、模型标识、认证方式在训练完成后由 sampling_client 提供,或通过控制台查看。业务系统按 OpenAI SDK 的标准用法即可接入:
from openai import OpenAI
client = OpenAI(
base_url="<your-mint-oai-compatible-endpoint>",
api_key="sk-your-api-key-here",
)
resp = client.chat.completions.create(
model="my-run-v1", # 训练时使用的 name
messages=[{"role": "user", "content": "3 * 7 ="}],
max_tokens=16,
temperature=0.7,
)
print(resp.choices[0].message.content)部署模式与推理适配
列出两种部署模式,选择会影响推理形态:
- LoRA 在线挂载:与基础模型共享显存,启动时间最快,适合多实验并行采样。
- LoRA 合并部署:把 LoRA 合并进底座生成完整权重,导出后可单独离线部署,适合私有化交付场景。
获取端点信息
企业版租户的 OpenAI 兼容 Endpoint 地址与鉴权凭据由 Mind Lab 团队随集群交付时提供;save_weights_and_get_sampling_client 返回的对象内也可以查询到当前 Endpoint 元信息。