随着 Kimi K3 完整权重开放,我们已经完成了 Kimi K3 的 GPU 权重部署,并将它接入现有 API 服务。现在,开发者可以通过 OpenAI 兼容接口直接调用 Kimi K3,不需要自行下载超大规模权重、搭建推理集群或维护服务进程。
本次上线提供两个服务档次:
kimi-k3:标准版
kimi-k3-fast:Fast 极速版
两个档次使用相同的 Kimi K3 权重,也拥有相同的上下文能力。它们之间的区别只有服务速度和价格:Fast 版响应更快,价格为标准版的 1.5 倍。
kimi-k3-fast 是本站提供的高速服务档,并不是 Moonshot AI 发布的另一套模型权重。
Kimi K3 是什么?
Kimi K3 是 Moonshot AI 发布的开放权重原生多模态 Agent 模型。根据官方模型卡,它采用混合专家架构,拥有 2.8T 总参数,每个 Token 激活约 104B 参数,并支持约 100 万 Token 上下文。
模型由 896 个路由专家组成,每个 Token 选择其中 16 个专家参与计算。它同时采用 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE 等架构设计,重点面向长时间编码、复杂推理、知识工作和 Agent 任务。
这里需要区分“开放权重”和“无条件开源”。Kimi K3 的代码与模型权重按照独立的 Kimi K3 License 发布,并不是 Apache 2.0 或 MIT License。准备进行大规模商业化部署的团队,仍应阅读并遵守官方许可条款。
标准版与 Fast 版有什么区别?
| 对比项 |
kimi-k3 |
kimi-k3-fast |
| 服务定位 |
标准版 |
Fast 极速版 |
| 模型权重 |
Kimi K3 |
与标准版相同 |
| 上下文能力 |
相同 |
相同 |
| 推理速度 |
标准速度 |
更快 |
| 价格 |
标准价格 |
标准版的 1.5 倍 |
| 推荐场景 |
日常调用、批量任务 |
实时交互、速度优先任务 |
Fast 版不会因为速度更快而更换成小模型,也不会缩短上下文。它可以理解为同一模型的高速服务档。
需要注意的是,“价格为 1.5 倍”并不代表速度固定提升 1.5 倍。实际响应时间还会受到输入长度、输出长度、上下文规模、并发情况和任务复杂度影响。
应该选择哪个版本?
如果业务对响应速度没有特别严格的要求,建议优先使用 kimi-k3。它更适合以下场景:
- 博客、文案和长内容生成
- 代码分析、代码审查和开发测试
- 文档整理、总结与知识问答
- 后台批处理任务
- 调用量较大、希望控制成本的应用
如果用户需要在前台等待结果,或者产品体验对响应速度比较敏感,可以选择 kimi-k3-fast:
- 在线聊天和智能客服
- IDE、工作台等交互式助手
- Agent 与多步骤工具调用
- 需要快速反馈的自动化工作流
- 用户主动选择的高优先级任务
一种实用的组合方式是:默认使用标准版,在用户选择“快速生成”或任务进入高优先级流程时切换到 Fast 版。这样既能控制整体成本,也能为速度敏感的用户提供更好的体验。
使用 OpenAI 兼容 API 调用
如果项目已经接入 OpenAI SDK,通常只需要替换 API 地址、密钥和模型名称。
cURL 示例
curl "https://你的域名/v1/chat/completions" \
-H "Authorization: Bearer 你的API密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [
{
"role": "user",
"content": "请帮我分析这个项目的架构,并给出三个优先级最高的优化建议。"
}
],
"stream": true
}'
需要使用 Fast 版时,只需修改模型名称:
{
"model": "kimi-k3-fast"
}
Python 示例
from openai import OpenAI
client = OpenAI(
api_key="你的API密钥",
base_url="https://你的域名/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "请总结这份需求,并整理成可以执行的开发任务。",
}
],
)
print(response.choices[0].message.content)
切换 Fast 版同样只需要改动一行:
model="kimi-k3-fast"
两个档次使用相同的接口格式,因此业务侧不需要维护两套调用逻辑。可以通过配置项、用户等级或任务优先级动态决定使用哪个模型。
使用 Kimi K3 时需要注意什么?
1. 保留完整的思考历史
Kimi K3 会返回 reasoning_content。在多轮对话和工具调用中,官方建议将上一轮返回的完整 Assistant 消息原样放回 messages,其中包括 reasoning_content 和 tool_calls,而不是只保留最终的 content。
如果中间丢失思考历史,长任务和 Agent 任务的稳定性可能受到影响。
2. 不建议在会话中途切换模型
已经由其他模型开始的长会话,不建议在中途直接切换到 Kimi K3。更稳妥的方式是新建会话,或者先将已有上下文整理成清晰摘要,再交给 Kimi K3 继续处理。
3. 多模态能力以当前接口说明为准
Kimi K3 具备原生多模态能力,但不同推理引擎与服务配置开放的输入类型可能不同。实际可用能力请以本站模型广场和接口文档为准。
常见问题
Fast 版的模型能力更强吗?
不是。两个档次使用相同权重并拥有相同的上下文能力。Fast 版的核心优势是更快的推理服务。
Fast 版一定快 1.5 倍吗?
不是。Fast 版的价格是标准版的 1.5 倍,但速度提升不是固定倍数,实际表现取决于请求内容和当时的服务负载。
可以在同一个项目中混合使用吗?
可以。普通任务使用 kimi-k3,实时交互或高优先级任务使用 kimi-k3-fast,只需切换请求中的 model 参数。
具体需要多少积分?
两个档次的实时积分价格请以模型广场展示为准。Fast 版价格始终按标准版的 1.5 倍计算。
写在最后
Kimi K3 GPU 权重版现已提供标准与 Fast 两个档次。
希望控制成本、处理日常或批量任务时,可以选择 kimi-k3;更重视响应速度和实时交互体验时,可以选择 kimi-k3-fast。
两个档次能力一致、接口一致,可以在同一个项目中灵活切换。接下来,我们也会继续优化推理稳定性、调用体验和相关文档。
参考资料