要点速览
- Kimi K3 于 2026 年 7 月 27 日放出开源权重,2.8 万亿参数是开源史上最大。权重体积约 1.4–1.5 TB,实际做服务要按 1.8–2.3 TB 显存预算规划——目前最可信的单机平台是 2.3 TB 显存的 NVIDIA DGX B300,国内渠道报价约 1200 万元。
- 显存只是入场券。MoE 模型逐 token、逐层现场选专家,跨机通信卡在生成每个字的关键路径上——用多台便宜服务器拼显存,装得下模型,跑不出可用的服务。
- 乐观情境下(token 全部卖出、7×24 满载),一台 B300 约 9 个月回本;把所有乐观假设叠满,最快能算到 49 天。但对多数企业,自建 K3 摊不平官方 API 每百万输出 token 15 美元的定价。
- 横向对比,自建的甜蜜点不在 2.8 万亿这一档:DeepSeek-V4 Flash(284B)两张卡就能跑满血,GLM-5.2(753B)一台 8 卡机装得下,DeepSeek-V4 Pro(1.6T)8 张 H200 够用——只有 K3 把最小可用单位从一台机器推到了一个机房。
- 更现实的路线是分层:隐私、低延迟、固定任务交给本地的 300B–900B 档开源模型,真正的前沿能力通过云端调用。
2026 年 7 月 27 日,月之暗面(Moonshot AI)正式放出了 Kimi K3 的开源权重。2.8 万亿参数,开源模型史上第一次摸到 3 万亿这个量级;多家媒体的第一波评测称其表现直逼顶级闭源模型。下载按钮对所有人开放,不收一分钱。
于是一个诱人的念头几乎同时出现在很多人脑子里:把它下载下来,部署在自己的机器上——一台不受 API 限制、数据不出门、完全属于自己的顶级“思考机器”。
这篇文章就来算这笔账。结论先放在这里:权重是免费的,跑权重的机器不是。而这台机器贵到什么程度、贵在哪里,比大多数人的直觉要复杂。
第一道题:1.4 TB 的权重放进哪里
先解释一件事:2.8 万亿参数的模型,为什么“只有”1.4 TB。
如果按训练常用的 16 位精度存储,2.8 万亿参数是 5.6 TB。据官方技术披露,K3 从监督微调阶段就按 MXFP4 权重做量化感知训练——MXFP4 是 OCP 标准里的“微缩放”格式,每 32 个权重共享一个 8 比特的缩放因子,平均每个权重约占 4.25 比特。2.8 万亿乘下来约 1.49 TB,这是理论下限,与官方口径的“约 1.4 TB”一致。也就是说,1.4 TB 已经是它的原生出厂精度,不是等你再压一轮的半成品。
1.4 TB 是什么概念?拿最普及的消费级显卡、12 GB 显存的 RTX 3060 来量,光装下权重就要 124 张。而这还只是权重:推理时的运行缓存、超长上下文的状态、路由信息都要额外空间,实际做服务要按 1.8–2.3 TB 的显存预算来规划。
市面上能一台装下它的机器只有一类:旗舰级 8 卡 AI 服务器。NVIDIA DGX B300 单机 8 张 B300 GPU,每张 288 GB HBM3e,总显存 2.3 TB——刚好够 K3 带着缓存住下,而且 8 张卡处在同一个 NVLink 高速互连域里。这台机器官方不公开定价,国内渠道报价约 1200 万元人民币,海外裸机行情约 55 万美元;整机满载功耗约 14 千瓦,相当于同时开着七八台家用空调。
看起来还有一条便宜路线:用 96 GB 显存的 RTX PRO 6000 拼。24 张卡(三台 8 卡服务器)总显存同样是 2.3 TB,连服务器、网卡、交换机、光模块一起算,投入约 400–500 万元,只有 B300 的零头。容量这道题好像解开了。
但这正是整笔账里最容易算错的地方。
第二道题:显存能相加,带宽不能
K3 是 MoE 模型(Mixture of Experts,混合专家)——2.8 万亿参数并不在每次计算时全部参与:模型的每个 MoE 层里有 896 个“专家”(各自独立的前馈网络参数分支),每生成一个 token 只激活其中 16 个。这是它 2.8 万亿参数还跑得动的原因。
但“只激活 16 个”不等于“只需要 16 个的显存”。哪 16 个被激活,是每个新 token 在每一层由路由器现场决定的:同一个词,走到第 5 层和第 40 层选中的专家不同;放进不同的上下文,选中的也不同。所以全部专家参数必须常驻显存待命——你永远不知道下一个字要用到哪一片参数。
这就是三台服务器拼装方案真正的麻烦。专家分散在三台机器上,而每生成一个 token,它的激活数据都要在每一层按路由结果发往专家所在的机器、算完再收回来;这一层不合并完,下一层不能开工。如果专家近似均匀分布,一个 token 在某一层同时触达三台机器的概率约 99.5%——这不是偶发的网络开销,是压在每个字、每一层上的固定税。三台机器之间哪怕用上 400 Gbps 互连,也远不是单机内部 NVLink 域的量级。
显存能相加,带宽不能——24 张卡加起来是 2.3 TB,加不出一张大卡。
这也是为什么月之暗面官方给出的部署建议是“64 张以上加速器组成的高带宽超节点”(也有部署指南按 64 张 80 GB 卡、共 5.12 TB 总显存起步)。对应到产品,就是 GB300 NVL72 这类把 72 张 GPU 放进同一个高速互连域的机型——业内估算价格在 2000 万到 3000 万元一档,且国内普通企业买不到。所以那套 400 万的 24 卡集群,准确的定位是“容量可能够的实验集群”,不是“最低可用的 K3 服务器”;真正可信的最小单机平台,仍然是 2.3 TB、8 卡同域的 B300。
顺带堵上另一条看似聪明的路:把 K3 再压一半、塞进一台 8 卡机行不行?前面说过,4.25 比特是它训练阶段就定型的原生精度,再往下压就进入 2 比特以下、没有任何可核验版本的无人区——现有研究显示传统 2 比特量化会明显损失能力,MoE 各专家敏感度不一,只会更难。省下的是显存,赌上的是模型本身。
第三道题:回本账,从印钞机情境算到现实
假设你真的买了一台 B300,把 K3 跑起来对外卖 token,多久回本?以下全部是情景估算,每个数字的前提都写在明处。
先看收入端的定价基准。K3 官方 API 的输出价是每百万 token 15 美元(约 108 元人民币),输入价按缓存命中与否在 0.3–3 美元之间。按聊天、RAG、Agent 混合的业务结构折算,每产出 100 万输出 token 连带的总收入约 260 元。
再看产出端。参考上一代 Kimi K2 在同级硬件上的公开吞吐数据推算,单台 B300 跑 K3 的聚合输出约 2000 token/秒——注意这是所有并发用户加总的吞吐,官方托管 API 实测的单用户流速是 62 token/秒。按 2000 token/秒 7×24 满载:一天约 1.73 亿 token,收入约 4.5 万元;电费按水电直供地区 0.38 元一度算,一天 132 元、一年 4.8 万——在这本账里电费小到几乎可以忽略。
拿 1200 万的机器价一除:约 268 天,9 个月回本。如果客户以 Agent 场景为主(输入 token 占比高、输入侧有溢价),能缩到 5 个月出头;再把海外 55 万美元的裸机价也叠上,所有乐观假设同时成立时,最快能算到 49 天。
数字很性感,但它站在三块地基上:买得够便宜、跑得够满、卖得出去。第一块看渠道,第二块看运维,真正致命的是第三块——2000 token/秒的产能一天就是 1.7 亿 token,你的客户在哪里?何况 K3 一开源,第三方推理平台会立刻接入并开打价格战,15 美元这个基准本身就是流动的(这是判断,不是数据)。按持有成本反推有一条更冷静的线:一套 24 卡集群一年折旧、电费加维护约 180–220 万元,要在官方 API 价格上摊平,需要全年 24 小时平均 530–650 token/秒的持续输出。多数企业的真实负载,离这条线很远。
印钞机和账单之间,隔着四个字:卖得出去。
横向对比:同是开源旗舰,门槛差出两个数量级
K3 不是唯一的选择。2026 年上半年,开源阵营已经形成清晰梯队——把几个主力模型的自建门槛摆在一起,K3 的位置就看清了:
| 模型 | 总参数 | 激活参数 | 权重体积(发布/常用量化) | 最小可用配置 | 硬件投入量级 | 许可 |
|---|---|---|---|---|---|---|
| Kimi K3 | 2.8 T | 每层 896 选 16 | ~1.4 TB(原生 MXFP4) | 单机 DGX B300(2.3 TB);官方建议 64 卡以上超节点 | 千万元级起 | 随权重发布 |
| DeepSeek-V4 Pro | 1.6 T | 49 B | ~0.8–0.86 TB(4 比特) | 8× H200(1.13 TB)一级 | 数百万元级 | MIT |
| GLM-5.2 | 753 B | ~40 B | FP8 约 750 GB;INT4 约 372 GB | 8× H200(FP8)或一台 8 卡 96 GB 机(INT4) | 百万元级 | MIT |
| DeepSeek-V4 Flash | 284 B | 13 B | 约 158 GB;重量化约 33 GB | 2× H200 / 2× RTX PRO 6000;重量化单卡可跑 | 十万元级 | MIT |
这张表读出来的规律,比任何单个数字都重要:一台 8 卡机(768 GB–1.1 TB 显存)既是私有化部署的天花板,也是它的甜蜜点。GLM-5.2 的 753B 用 INT4 量化后正好舒服地住进去;DeepSeek-V4 Pro 顶着天花板但住得下;V4 Flash 甚至两张卡就是满血版。只有 K3,把“最小可用单位”从一台机器推到了一个机房。
换句话说,K3 真正的意义不是给普通企业自建用的。它更像一张写给整个行业的产品需求书:需求方是云推理平台和下一代硬件厂商——谁能造出 TB 级统一内存、高速互连的机器,谁就接得住这一代前沿开源模型。在那台机器出现之前,开放权重和普通人能自建,会越来越像两件不相干的事。
这跟你有什么关系
如果你是个人开发者:别看 K3,你的起点是 V4 Flash 这一档——重量化后约 33 GB,一张 48 GB 工作站卡或两张 4090 就能跑起来,十万元内解决战斗。把 K3 的权重卸载到内存硬盘,只能证明它会吐字,那不是可用的服务。
如果你是想私有化部署的企业:一台 8 卡机配 GLM-5.2 或 DeepSeek-V4,数据不出门、百万元级投入,覆盖绝大多数内部场景。K3 的能力,等第三方推理平台把价格卷下来之后通过 API 用——比自建便宜,而且快。
如果你真想做 token 生意:先回答“一天 1.7 亿 token 卖给谁”,再谈买什么机器。决定回本速度的从来不是硬件参数,是你的场景。
开源解决的是“能不能拿到”,从没承诺过“跑不跑得起”。开放权重运动走到 2.8 万亿参数这一站,普通人得到的不是一台免费的思考机器,而是一个清晰的分层格局:本地负责隐私、延迟和固定任务,云端负责前沿。
模型免费了,账单才刚开始。
常见问题
Q:个人电脑能跑 Kimi K3 吗?
A:装不下。K3 权重约 1.4 TB,相当于 124 张 RTX 3060 的显存总和;把权重卸载到内存或硬盘只能让它勉强吐字,无法形成可用的服务。个人玩开源大模型的现实起点是 DeepSeek-V4 Flash 这类 284B 档模型——重量化后约 33 GB,单张工作站卡可跑。
Q:为什么显存凑够了还是跑不好?
A:K3 是 MoE 模型,每生成一个 token 都要在每一层重新选择 16 个专家,跨机器的数据搬运卡在生成的关键路径上。多台 PCIe 服务器拼出的显存总量再大,机间带宽也远低于单机内的 NVLink 互连——显存能相加,带宽不能。
Q:自建划算还是用 API 划算?
A:取决于负载稳定性。按行业估算,一套 24 卡集群年持有成本 180–220 万元,需要全年平均 530–650 token/秒的持续输出才能摊平官方 API 定价;多数企业达不到这条线。更现实的组合是本地跑 300B–900B 档开源模型处理固定负载,前沿能力走云端 API。
信息来源
- VentureBeat: China's Moonshot AI releases Kimi K3, the largest open-source model ever
- MarkTechPost: Moonshot AI Releases Kimi K3 — a 2.8 Trillion Parameter Open MoE Model
- Northflank: Kimi K3 — benchmarks, pricing, hardware requirements, and self-hosting
- Hugging Face Blog: Kimi K3 Model Overview — MXFP4 Quantization and Open Weights
- AceCloud: NVIDIA HGX B300 Explained — Specs, Memory & NVLink
- Knightli: DeepSeek V4 VRAM Requirements — Pro vs Flash Quantization Table
- Local AI Master: GLM-5.2 — Biggest Open Model You Can Self-Host
- Unsloth Docs: GLM-5.2 — How to Run Locally