上一篇写过 Kimi K3 的模型本身,后台有人问:API 到底怎么调?要花多少钱?这篇只讲实操,数据来自 Kimi 开放平台(platform.kimi.com)2026 年 9 月的官方文档,价格以那个时间点为准,下单前自己再核一遍。
第一步:拿 Key,充 10 块钱
注册登录 platform.kimi.com,在控制台的 API Keys 页面创建一个 Key。注意 K3 有点特殊:它是旗舰模型,要在开放平台充值后才能调用,最低充 10 元。新用户注册送的那 15 元代金券,对 K3 无效——我第一次试的时候还纳闷账户里有钱为什么报错,翻了文档才发现这条。
Key 建议放环境变量,别直接写死在代码里:
export MOONSHOT_API_KEY="你的Key"
第二步:确认模型名和 base_url
API 兼容 OpenAI 和 Anthropic 两种格式,base_url 是 https://api.moonshot.cn/v1。K3 的模型名就一个字符串:kimi-k3。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "用一句话介绍 Kimi K3。"}],
)
print(r.choices[0].message.content)
如果你的代码之前在用 K2.x,记得把 thinking 参数删掉,K3 换成了顶层的 reasoning_effort,见下面第四步。
第三步:搞清楚价格,别被账单吓到
官方定价(每 1M tokens,人民币):
- kimi-k3:输入未命中 20 元,缓存命中 2 元,输出 100 元;上下文窗口 1,048,576 tokens
- kimi-k2.7-code:输入未命中 6.5 元,缓存命中 1.3 元,输出 27 元,256K 窗口
- kimi-k2.6:输入未命中 6.5 元,缓存命中 1.1 元,输出 27 元,256K 窗口
单价看着不贵,但有两处容易多花钱。一是 reasoning tokens 也会产生费用,聊天打发时间不需要深度推理时把 effort 调低能省不少(下一节讲怎么调)。二是输出价格是输入的 5 倍,让模型大段复述原文是最亏的用法。
中文文本大概 1 token 对应 1.5 到 2 个汉字,粗算够用了。在意精确数字可以去调 Token 计算接口。另外 K3 支持上下文缓存,重复喂同一段长文档时按命中价格计费,只有原价的十分之一——同一个 system prompt 或者同一份资料反复用的场景,记得利用这个。
还有个便宜的绕路:BatchJob 异步批处理的接口定价更低,不着急的任务可以走这条路。
第四步:reasoning_effort 怎么设置
K3 每次调用都推理(thinking 已经取消了),能控的是推理深度,三档:low、high、max,默认 max。
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "推导这个数列的通项公式:1, 4, 9, 25, 64, ..."}],
reasoning_effort="high",
)
# 思考过程在 reasoning_content 里
print(r.choices[0].message.reasoning_content)
print(r.choices[0].message.content)
我的用法:日常简单任务用 low,写代码做方案用 high,默认的 max 只留给真的难啃的题。K3 本来就是深度思考型的模型,全都用 max 会显著拉高 token 消耗和延迟。同样一段输入,不同档位下的 token 数差别不小,算大账之前先试两档比较一下。
第五步:限速早知道
限速跟着累计充值金额走。充 10 块(Tier 级别最低档)并发只有 1,RPM 3,TPM 50 万,TPD 150 万。充到 50 元后并发 15、RPM 100,TPD 不再限制。测试阶段偶尔连发几个请求被 429 拦下来是正常的,攒实验代码的时候加个简单的退避(sleep 几秒重试)就够了。
对照之前的定位:K3 适合长上下文、代码、深度推理这类任务。要是你的场景只是日常对话和搜索问答,翻之前写过的 Kimi 免费横评,挑个便宜模型更划算。
两个坑
加盟会费白花钱。前面提过,15 元代金券不能抵 K3 调用。有空去领一下确定还能拿到就行,别为了 15 块钱把测试计划推一周。
上下文塞太满,费用翻好几倍。1M 窗口不等于要装满。输入 token 越多,不单费用越高,长文本处理也更慢。文档解析类接口(上传提取内容)本身有限时免费活动,但提取出来的内容作为输入传给模型照样算 token,别把整本 PDF 灌进去只为了问一个章节的结论,先做切分。
准备好跑通第一个请求后,建议先用几个 prompt 小成本测一测,同一个任务在 low 和 max 下的 token 差有多明显,再确定自己日常用哪个档位。