首页 / 核心业务 / Token 工厂
Token 工厂

开箱即用的大模型 API

主流开源大模型统一接入,OpenAI 接口完全兼容,高并发低延迟,按 token 透明计费——把模型能力变成随取随用的水电煤,注册即可调用。

0
日均处理 token
0
峰值 tokens/分钟
0
主流大模型接入
0
服务可用性
<2s
首字延迟 TTFT (P90)
0 t/s
输出速度高达
0
缓存命中率
0
API 峰值 QPS
如何开始

四步,从注册到生产调用

不用排队开白名单,也不用对接商务——控制台自助完成全部流程,几分钟内发出第一次调用。

注册账号

打开 API 控制台注册即开通,支持小额充值先行试用。

创建 API Key

控制台一键生成密钥,支持多 Key 管理与分组用量隔离。

接入调用

OpenAI 接口兼容,把 base_url 指向 api.tokmo.cn,现有 SDK 无需改动。

按量计费

按 token 计费,用多少付多少,账单明细到每一次调用,控制台实时可查。

开发者优先

改一行 base_url,完成迁移

OpenAI 接口完全兼容——无论你在用官方 SDK、LangChain 还是自研网关,把 base_url 指向元动智启即可切换,业务代码零改动。

流式输出:SSE 流式响应,首 token 低延迟
前缀缓存加速:长会话与多轮对话命中缓存,更快更省
私有化部署可选:同款推理栈可落地你的环境
# 任何 OpenAI 兼容客户端,改 base_url 即可
from openai import OpenAI

client = OpenAI(
  base_url="https://api.tokmo.cn/v1",
  api_key="sk-...",
)

resp = client.chat.completions.create(
  model="glm-5.2",
  messages=[{"role": "user",
    "content": "帮我写一段产品介绍。"}],
  stream=True,
)
热门模型

热门模型,都在这里

持续跟进主流开源大模型版本,新模型快速上架。完整模型列表以 API 控制台为准。

GLM5.3
GLM5.3
旗舰
GLM5.3-Flash
GLM5.3-Flash
主力
DeepSeek-V4.1-Flash
DeepSeek-V4.1-Flash
热门
K3
K3
长文本
HY4-Preview
HY4-Preview
新上架

* 以上为平台热门模型示意,完整模型列表以 API 控制台为准,持续更新中。

开始使用

现在注册,几分钟内发出第一次调用

从注册到首次调用,只要几分钟。大用量、定制模型或私有化需求,欢迎与我们聊聊。