首页 / 核心业务 / Token 工厂
Token 工厂
开箱即用的大模型 API
主流开源大模型统一接入,OpenAI 接口完全兼容,高并发低延迟,按 token 透明计费——把模型能力变成随取随用的水电煤,注册即可调用。
0
日均处理 token
0
峰值 tokens/分钟
0
主流大模型接入
0
服务可用性
<2s
首字延迟 TTFT (P90)
0 t/s
输出速度高达
0
缓存命中率
0
API 峰值 QPS
如何开始
四步,从注册到生产调用
不用排队开白名单,也不用对接商务——控制台自助完成全部流程,几分钟内发出第一次调用。
注册账号
打开 API 控制台注册即开通,支持小额充值先行试用。
创建 API Key
控制台一键生成密钥,支持多 Key 管理与分组用量隔离。
接入调用
OpenAI 接口兼容,把 base_url 指向 api.tokmo.cn,现有 SDK 无需改动。
按量计费
按 token 计费,用多少付多少,账单明细到每一次调用,控制台实时可查。
开发者优先
改一行 base_url,完成迁移
OpenAI 接口完全兼容——无论你在用官方 SDK、LangChain 还是自研网关,把 base_url 指向元动智启即可切换,业务代码零改动。
流式输出:SSE 流式响应,首 token 低延迟
前缀缓存加速:长会话与多轮对话命中缓存,更快更省
私有化部署可选:同款推理栈可落地你的环境
# 任何 OpenAI 兼容客户端,改 base_url 即可
from openai import OpenAI
client = OpenAI(
base_url="https://api.tokmo.cn/v1",
api_key="sk-...",
)
resp = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user",
"content": "帮我写一段产品介绍。"}],
stream=True,
)
from openai import OpenAI
client = OpenAI(
base_url="https://api.tokmo.cn/v1",
api_key="sk-...",
)
resp = client.chat.completions.create(
model="glm-5.2",
messages=[{"role": "user",
"content": "帮我写一段产品介绍。"}],
stream=True,
)
热门模型
热门模型,都在这里
持续跟进主流开源大模型版本,新模型快速上架。完整模型列表以 API 控制台为准。
GLM5.3
旗舰GLM5.3-Flash
主力DeepSeek-V4.1-Flash
热门K3
长文本HY4-Preview
新上架* 以上为平台热门模型示意,完整模型列表以 API 控制台为准,持续更新中。