技术文章

Kimi K3 部署:容量、配方与成本怎么核算

依据官方模型卡和推理引擎配方,区分 Kimi K3 权重容量、并发与吞吐要求,列出部署验收和成本计算方法。

显存能装下权重,只是部署的第一步

Kimi K3 的官方模型卡列出 2.8T 总参数、104B 激活参数和约 100 万 Token 上下文,权重采用原生 MXFP4。激活参数描述每个 Token 涉及的计算量,不能用来直接推算整套模型的存储或显存。本文是公开部署资料的核对与容量估算,没有进行 K3 集群部署或性能实测。来源:Moonshot AI 模型卡

真正的部署方案还取决于并发、输入输出长度、缓存、通信、推理引擎和服务目标。原文将某种服务器组合估算为 750–900 万元,这不是部署门槛,也不是采购报价;本版撤下该总价,改为列出可核对的配置与成本项目。

把理论下限、配方和验收容量分开

只按参数数量与位宽的理论值:
2.8 × 10^12 参数 × 4 bit / 8 ≈ 1.4 × 10^12 byte
即约 1.4 TB(十进制),尚未计量化元数据和其他张量。

运行容量还包含:
权重 + KV 缓存 + KDA 状态 + 通信缓冲 + 临时工作区
磁盘还需考虑:下载临时文件、不同版本权重、运行日志和回退副本。

这只是估算下限,不能据此保证某组 GPU 可运行目标并发。长上下文并不意味着所有请求都可以同时用满最大窗口。先定义典型输入长度、最大输入长度、输出上限、并发和延迟目标,再测峰值显存、可接纳请求数和失败恢复。

官方配方也有验证范围

2026-09-05 读取的 SGLang 配方按硬件与工作负载提供不同组合,例如 H200 的常规形态为 2×8,高吞吐形态为 4×8。页面当时仅将 B300 1×8 的部分 Unified 配置标为完成速度验证,其他配置仍有最终验证中的说明。不能把表中每种组合都写成本站验证过的生产方案。来源:SGLang Kimi K3 配方

要核对的项目记录什么
硬件与拓扑GPU 型号、每节点卡数、节点数、互联与网卡。
软件版本驱动、CUDA/ROCm、引擎提交或镜像 digest、通信库。
运行形态统一服务或预填充/解码分离,TP/PP/EP 配置。
容量与效果请求长度分布、并发、显存峰值、错误率、生成正确性。

vLLM 的配方页面也会随硬件和内核更新。本文核对到的页面更新日期为 2026-08-27,包含驱动、推理解析器和工具调用配置要求;使用其命令构建器选择实际硬件后,应保存输出及对应版本,再在隔离环境验证。来源:vLLM Kimi K3 配方

从启动成功走到可用服务

  1. 准备:核对模型许可、下载文件、可用空间和网络;固定模型修订与镜像版本。
  2. 启动:使用匹配硬件的官方配方。检查权重加载、跨节点通信、服务就绪和实际可用容量。
  3. 功能:用公开输入验证短对话、长输入、工具调用、错误参数与断连;保存脱敏请求和输出。
  4. 负载:从单请求逐步增加并发;记录首 Token 延迟、输出速度、端到端耗时、排队与错误率。
  5. 恢复:测试节点退出、请求取消、服务重启和版本回退。恢复后确认没有混入旧状态或漏记失败请求。

模型卡要求多轮对话和工具调用回传完整的助手消息,包括相关推理字段与工具调用。接入层如果只保留 content,可能改变预期行为;应依照官方使用示例检查,而不是套用所有模型通用的消息裁剪规则。来源:Kimi K3 Model Usage

按自己的负载计算总成本

采购或租用成本至少分为服务器、网络、存储、机房、电力、维护和冗余。硬件报价取决于地区、供货与服务合同;需要实际询价,不能把新闻里的服务器价格直接换算为完整部署成本。

年度电费示例(仅演示公式):
平均 IT 功率 14 kW × PUE 1.3 × 8760 h × 0.8 元/kWh
= 127,545.60 元/年

每个完成任务的成本:
(折旧或租金 + 电力 + 运维 + 网络存储 + 失败重试开销)
/ 同期完成且通过验收的任务数

14 kW、PUE 1.3 与电价 0.8 均为假设,未包含额外峰值、冷备和人员费用;不是 K3 官方功率指标。比较 API 与自部署时,应使用同一任务集、相近质量标准和完整周期。空闲率较高或维护能力不足时,单看 Token 单价可能得出错误结论。

来源与更新边界

2026-09-05 更新:保留官方模型规模,区分容量与吞吐配方,撤下未经报价支持的固定采购总价。本页不声称已完成硬件验收或给出最低可用配置。