显存能装下权重,只是部署的第一步
Kimi K3 的官方模型卡列出 2.8T 总参数、104B 激活参数和约 100 万 Token 上下文,权重采用原生 MXFP4。激活参数描述每个 Token 涉及的计算量,不能用来直接推算整套模型的存储或显存。本文是公开部署资料的核对与容量估算,没有进行 K3 集群部署或性能实测。来源:Moonshot AI 模型卡。
真正的部署方案还取决于并发、输入输出长度、缓存、通信、推理引擎和服务目标。原文将某种服务器组合估算为 750–900 万元,这不是部署门槛,也不是采购报价;本版撤下该总价,改为列出可核对的配置与成本项目。
把理论下限、配方和验收容量分开
只按参数数量与位宽的理论值:
2.8 × 10^12 参数 × 4 bit / 8 ≈ 1.4 × 10^12 byte
即约 1.4 TB(十进制),尚未计量化元数据和其他张量。
运行容量还包含:
权重 + KV 缓存 + KDA 状态 + 通信缓冲 + 临时工作区
磁盘还需考虑:下载临时文件、不同版本权重、运行日志和回退副本。
这只是估算下限,不能据此保证某组 GPU 可运行目标并发。长上下文并不意味着所有请求都可以同时用满最大窗口。先定义典型输入长度、最大输入长度、输出上限、并发和延迟目标,再测峰值显存、可接纳请求数和失败恢复。
官方配方也有验证范围
2026-09-05 读取的 SGLang 配方按硬件与工作负载提供不同组合,例如 H200 的常规形态为 2×8,高吞吐形态为 4×8。页面当时仅将 B300 1×8 的部分 Unified 配置标为完成速度验证,其他配置仍有最终验证中的说明。不能把表中每种组合都写成本站验证过的生产方案。来源:SGLang Kimi K3 配方。
| 要核对的项目 | 记录什么 |
|---|---|
| 硬件与拓扑 | GPU 型号、每节点卡数、节点数、互联与网卡。 |
| 软件版本 | 驱动、CUDA/ROCm、引擎提交或镜像 digest、通信库。 |
| 运行形态 | 统一服务或预填充/解码分离,TP/PP/EP 配置。 |
| 容量与效果 | 请求长度分布、并发、显存峰值、错误率、生成正确性。 |
vLLM 的配方页面也会随硬件和内核更新。本文核对到的页面更新日期为 2026-08-27,包含驱动、推理解析器和工具调用配置要求;使用其命令构建器选择实际硬件后,应保存输出及对应版本,再在隔离环境验证。来源:vLLM Kimi K3 配方。
从启动成功走到可用服务
- 准备:核对模型许可、下载文件、可用空间和网络;固定模型修订与镜像版本。
- 启动:使用匹配硬件的官方配方。检查权重加载、跨节点通信、服务就绪和实际可用容量。
- 功能:用公开输入验证短对话、长输入、工具调用、错误参数与断连;保存脱敏请求和输出。
- 负载:从单请求逐步增加并发;记录首 Token 延迟、输出速度、端到端耗时、排队与错误率。
- 恢复:测试节点退出、请求取消、服务重启和版本回退。恢复后确认没有混入旧状态或漏记失败请求。
模型卡要求多轮对话和工具调用回传完整的助手消息,包括相关推理字段与工具调用。接入层如果只保留 content,可能改变预期行为;应依照官方使用示例检查,而不是套用所有模型通用的消息裁剪规则。来源:Kimi K3 Model Usage。
按自己的负载计算总成本
采购或租用成本至少分为服务器、网络、存储、机房、电力、维护和冗余。硬件报价取决于地区、供货与服务合同;需要实际询价,不能把新闻里的服务器价格直接换算为完整部署成本。
年度电费示例(仅演示公式):
平均 IT 功率 14 kW × PUE 1.3 × 8760 h × 0.8 元/kWh
= 127,545.60 元/年
每个完成任务的成本:
(折旧或租金 + 电力 + 运维 + 网络存储 + 失败重试开销)
/ 同期完成且通过验收的任务数
14 kW、PUE 1.3 与电价 0.8 均为假设,未包含额外峰值、冷备和人员费用;不是 K3 官方功率指标。比较 API 与自部署时,应使用同一任务集、相近质量标准和完整周期。空闲率较高或维护能力不足时,单看 Token 单价可能得出错误结论。
来源与更新边界
2026-09-05 更新:保留官方模型规模,区分容量与吞吐配方,撤下未经报价支持的固定采购总价。本页不声称已完成硬件验收或给出最低可用配置。