两件事看着矛盾,实则指向两条截然不同的商业逻辑。C 端卖的是 API 调用服务,开源释放的则是产业链改造权。
点开 Hugging Face 上的 Kimi K3 页面,594GB 的权重文件就在那儿摆着。多数人默默关掉标签页,觉得这跟自己无关。但 K3 真正的买家,偏偏是那些跑不起它的人。
谁才扛得住 2.8 万亿参数?
先看清硬件门槛。经过 MXFP4 量化后,模型体积约为 594GB,得凑齐 8 张 H100 80GB 显存才能勉强塞进去。推理时 KV 缓存和激活值会瞬间撑爆显存,生产级场景通常需要由 64 张以上 H100 组成的超节点,硬件成本起步就是百万美元。
单张 RTX 4090,连 K3 的一个专家模块都装不下。
Llama 4 最小的 7B 版本能在笔记本上跑,DeepSeek V4 的 490B 活跃参数靠几张消费级卡也能折腾。K3 的 2.8 万亿参数,直接把门槛拉到了机房级别。普通人、小团队,甚至大部分中型企业,都被挡在门外。
K3 的完整自托管,眼下仍是头部云厂商和大型科研机构的游戏。但游戏的主角,并不是他们。
云厂商抢跑,小 B 端吃红利
直接接盘的是云厂商和软件服务商,最终吃到红利的却是小 B 端和垂直团队。中间隔着产业链的分层传导,不是一步到位的普惠。
开源当天,Together AI、Modal 等海外平台便宣布 day-0 接入。国内跟进更猛:腾讯云 ADP、TokenHub、阿里云百炼、国家超算互联网,乃至值得买科技的 OpenHubs,都在第一时间上线了 K3 的调用通道。你不用买 H100,不用租机房,直接调云厂商 API 就能用上 2.8 万亿参数的基座。
小 B 端从“买不起显卡”变成了“选哪家云”,议价权出现了。此前只有 Moonshot 官方一家提供 K3 API 服务,定价权全在厂商手里;现在多家云厂商同步托管,相当于多了多个供货渠道,长期看定价不会被单一厂商锁死。
Modified MIT 许可证是另一把钥匙。它允许商用、修改、再分发,跟 AGPL 那种“改了也必须全部开源”的强约束完全不同。商业公司能基于 K3 做闭源的行业定制模型,不用公开业务代码。闭源 API 永远给不了这个权利。
更隐蔽的是 MoE 架构。K3 采用稀疏专家架构,理论上支持选择性蒸馏。未来社区或许只蒸馏高频激活的专家子集,做出单卡可跑的“K3 学生模型”。几个月后,70B 甚至 7B 的蒸馏版可能出现。这只是基于架构开放后的产业预期,今天还没有。
DeepSeek 走了同一条路。V4 正式版通过峰谷定价和 Flash/Pro 双档位,把 API 成本打到行业地板。Flash 缓存未命中输入价 0.14 美元,Pro 版也远低于行业均价。
两者底层逻辑很直白:用开放权重换生态规模,靠生态规模摊薄单位成本,最终靠 API 服务和商业解决方案变现。做公益、让人人本地部署,从来不是目的。
K3 不会完全复刻 DeepSeek 的价格战路线。后者靠极低的激活参数实现了极致性价比,K3 主打前沿性能,短期内成本很难打到同等水平。它的价值,在于把前沿性能级的改造权下放了。
硬件门槛一点没降,降的是改造门槛。这套红利只通过产业链分层传递:云厂商扛算力、微调团队切场景、蒸馏生态降门槛,最终传导到小 B 端。个人开发者今天吃不到肉,游戏规则已经变了。
改造权比下载按钮重要
对比闭源和开源,小 B 端多了什么?闭源模型只有 API 一条路,价格大厂定,定制靠提示词,天花板肉眼可见。开源模型有 API、微调、蒸馏、自托管四条路,你可以根据预算和技术能力选最适合自己的那条。
别激动。K3 API 官方定价 3 美元输入、15 美元输出,缓存命中仅 0.30 美元。月之暗面称编程场景缓存命中率可超 90%,意味着重度用户的实际输入成本约为标价的 1/10。对高频调用的小 B 端来说,这不算白菜价,也不算天价。Moonshot 自身算力紧张,API 供应还不稳定,云厂商托管价格也未见大规模竞价降价。
K3 开源给的是一张期货合约。它的兑付依赖开源协议持续宽松、云厂商算力供给充足、社区生态持续活跃。若后续海外针对中国开源模型出台限制政策,海外托管与生态的传导也会先受阻。任何一个环节收紧,中小企业的选择权都会快速缩水。
2.8 万亿参数本身不是给小团队准备的,但基于它生长出来的生态,最终会传导到小团队手里。今天兑现不了,改造权已经下放。
真正的变化在于规则本身变了。以前闭源大厂一手攥着模型、一手定着价格,你连议价、定制的资格都没有。现在 K3 把模型改造权扔到了牌桌上。哪怕你暂时买不起入场筹码,这场游戏的定价权,也已经不再只攥在少数几家手里了。
跑不起它的人,才是最终买家。








