K3模型意外走红,Kimi团队却不得不按下暂停键。
7月19日深夜时分,月之暗面Kimi团队发布公告:Kimi K3上线仅48小时,用户请求量就大幅超出预估。由于算力资源紧张,团队决定暂时停止接收新的用户订阅,将有限的算力优先供应给已有订阅资格的用户。
会员体系发生变更,被划分为Kimi主权益与Code权益两部分,旨在更精准地分配资源。稍后的官方回应透露,Kimi并未调整会员体系本身,只是在算力受限的状况下,重新平衡了用户体验。
也就是说,K3的热度已高到让算力系统不堪重负,因此只能婉拒新用户,专注于服务老用户。
Kimi的“韬定律”
眼下,众多模型厂商都在拼尽全力扩大用户规模,通过免费、降价等手段吸引新用户。相比之下,Kimi的做法颇为特别。
然而,随着模型能力的提升、支持语境的延长以及用户调用频率的增加,对推理算力的需求也随之增长。在“K3的请求量接近现有算力集群的极限”的情况下,Kimi也遭遇了类似“豆包式”的困境:C端用户数量增加,对收益的贡献并不显著,但GPU却承受着巨大压力。
作为月之暗面首款3万亿参数级MoE模型,K3的总参数量达到2.8万亿。根据常规理解,这个规模的模型每次输出都需要消耗指数级的算力。但在其独特核心架构的支持下,K3达到了华为在芯片领域提出的“韬定律”效果。
这个架构被视为超级引擎,集成了三项关键技术:KDA(Kimi Delta Attention)混合线性注意力机制、注意力残差(Attention Residuals)以及高稀疏度MoE,让每一份算力都能转化为最大的模型效果。
长期以来,芯片产业依照摩尔定律,通过缩小晶体管尺寸来提升性能。当先进制程工艺接近物理边界、成本剧增时,单纯依靠堆砌硬件的增长模式遇到了瓶颈。
华为近期提出的“韬定律”,突破了“空间缩微”的传统观念,转向了“时间缩微”的思路:通过逻辑折叠、三维堆叠、全链路架构优化,缩短信号传输延迟、减少数据的多余搬运工作量,在成熟制程上实现能量效率的显著提升。
其核心原则是:在硬件受限或成本限制的条件下,通过系统级的架构创新来完成性能的飞跃。
从我的观察来看,K3采用的KDA混合线性注意力机制,正是AI领域的“韬定律”实践案例。
须知,Transformer架构在注意力机制上最为耗费算力。标准注意力机制的计算复杂度随着序列长度按平方级增长,在百万级上下文任务中,大部分算力都被用于维持长序列的注意力矩阵。KDA机制将大部分注意力层的计算复杂度从平方级降至线性。
根据月之暗面早先发布的技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存空间的利用率最高削减75%,在100万上下文长度下,解码的吞吐量提升到原来的6倍。配合注意力残差与高稀疏度MoE技术,训练效率提高约25%,额外成本不到2%。
这是对“模型生产效率”的深刻改造。如果说硅谷主流的Transformer路线是“大力出奇迹”的燃油车,KDA则像是追求极致热效率的混合动力引擎。
SemiAnalysis的报告指出,KDA能将推理速度加快300%,同时在长上下文处理上还能保持接近Transformer的表现水平。这表示在相同的算力环境下,K3能产出更多的有效智能内容。
开发者社区的实测反馈显示,K3在长流程Agent任务和代码生成方面的表现令人瞩目,已经具备了与国际领先模型掰手腕的实力。
从根本角度看,K3依然遵循Scaling Law(缩放定律),但它的锋芒指向了粗放的算法浪费。当硅谷AI公司还在不断购买GPU、堆砌算力时,Kimi通过重塑算法链路、简化计算过程,在有限的算力条件下,达成了性能与效率的平衡,走出了一条“每瓦特智能产出比”最大化的通路。
这让华尔街的分析师和投资者感到意外,他们像惊讶DeepSeek一样,再度对硅谷数十亿美元投资AI能否获得相应产出、美国AI的领先地位是否会被削弱产生了疑问。
与此同时,企业用户和开发者也开始关注AI使用成本。一部分开发者已经开始采用“模型路由”(Model Routing)服务,根据不同任务的性质自动选定成本最低、效率最理想的AI模型,这其中当然包含了Kimi等中国本土模型。
杨植麟摸高
回头审视,Kimi算力遭遇超载是技术成功的副产品:模型效率的提升降低了单次使用成本,结果却刺激了需求总量爆发式增长。
唐杰在7月11日发起的“Touch High摸高计划”里明确提到,“不登顶,就是失败”,同时确定未来两年不追求短期应用盈利,而是集中资源攻克AGI的四大核心方向,计划筹集资金,意图在机械可解释性技术领域取得突破。
可以说智谱此举是在上市后发起的破釜沉舟行动。他们期望通过冲击技术顶点,来加固“全球大模型第一股”的市场形象,并缓解现实中的经营压力。
我在杨植麟的决策中,观察到Kimi在三个维度上进行了“摸高”:
首先是算力挑战上的转变,从流量视角切换到价值视角。公开资料透露,Kimi的API业务占比已经突破70%,与此前主要依赖C端订阅模式截然不同。保存量用户,拒新用户,实际上是将在有限算力向高价值场景倾斜,避免低价值的泛C端流量挤占已变身收入支柱的B端业务配额。
其代价显而易见。比如“优先保障存量用户”的执行细则不公开透明,哪些请求能优先处理、哪些被降级处理,若处置不当,都可能磨损用户信任。
长远考虑,Kimi要完成从技术新星向成熟AI头部企业的转型,就必须加固弹性算力池、分级响应机制、动态调度能力等基础建设。
其次是在定价策略上的压力测试,Kimi正进行从低价自助餐到价值分层的尝试。公告中提及的“拆分Kimi主权益与Code权益”,既是应对算力短缺的临时手段,也可能隐含了其定价体系重构的信号。
从前,无论是用户编写代码、检索资料还是闲聊互动,都要求支付相同费用、消耗相同算力。当高算力消耗的Code用户比例增加,这种模式必然导致结构性不匹配。
Kimi借此契机进行会员权益拆分,也是在进行基于使用场景的重新定价:普通用户享享基础服务,高级用户需为高价值能力支付加价。
这是在尝试通过价值用户分层,来争夺模型产品定价权的举措。目前,K3的收费标准已达每百万Token 2.3美元,虽不及海外顶级模型,但已创下国产模型的新高。
或许是Kimi也想告别低价策略,向外界传递一种观念:高性能模型具备其合理价格。接下来,大模型市场的竞争将从“比拼参数量”转向“比拼基础设施”、“比拼成本定价”。
这一步,比登顶排行榜更艰难,也离商业真谛更近。
第三是在定位上的跃迁,Kimi从地缘性变量转变为定价参照点。K3面世后即获得全球瞩目。在独立AI模型评测机构Artificial Analysis公布的最新“智能指数(Intelligence Index)”中,其综合得分达到57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),超越Claude Opus 4.8(56分)。
这一分数也打破“开源模型落后闭源模型半代”的行业固有认知。
同时,K3的影响力已超出技术界。美国科技投资机构视其为AI发展的转折点,认为优质开源模型正在加速能力的传播扩散;加州大学伯克利分校计算机科学教授声称,K3将中国开源模型与美国前沿模型的差距,缩小到2到3个月。
资本市场的反应同样剧烈,K3问世首日,英伟达单日市值蒸发约1111亿美元;摩根大通策略师在报告里直接称其为“DeepSeek 2.0”。
这一系列快速变化,才是改变定价逻辑的关键因素。
此外,月之暗面ARR(年化收入)到6月已经接近3亿美元,海外业务增速400%,即便在提价60%后收入仍实现增长,这三组数据叠加,显示Kimi的“开源+效率”模式可以规模变现。
消息还透露,月之暗面正在计划最快六个月内在香港完成上市,估值在半年内从43亿美元暴涨至315亿美元,涨幅超过7倍。
这些都是资本市场在非硅谷主流路径的“确权”。投资者为“能实现单位经济模型的SOTA”投下资本时,也表明Kimi已建立起独立的估值标准,不再需要对照OpenAI或Anthropic来证明自身价值。
尽管如此,K3距离AGI还有漫长路要走。以跑分数据为例,虽然K3仅比Fable 5低3分,但其间仍存在差距。
另外,Kimi在技术报告里承认了两个部署环节的不足:一是K3在训练时保留了完整的思考历史(thinking history),如果调用方未能准确传递之前的推理过程,或在会话中切换到K3的模型,输出质量就会大打折扣;
二是K3在任务模糊时会“过度冒进”,更倾向于替用户做决定。这种“自作主张”在需要精确执行的工程类任务中,容易引发连锁错误。
还有个容易被忽视但非常重要的隐患:幻觉。Artificial Analysis在测评时特别指出,K3的幻觉率比上一代 K2.6有所增加。
某种程度上,K3的亮眼表现与潜在问题,是整个行业算力供需失衡的写照,也是中国AI产业面临算力卡脖子、商业化尚未完善、用户期望过高等多重挑战下的共同体验。
这些AI企业的每一次过载、每一次“熔断”,都是中国AI在实现“摸高”过程中必须跨越的障碍。可以确定的是,一个新的竞争阶段已经开启,大模型将从较量能力过渡到比较算力配置。
谁能在算法、算力储备等基础建设上建立竞争优势,谁就能成为最后的胜利者,并将定义下一代AI公司的生存准则。
参考资料:
字母榜,《K3发布48小时》
锦缎,《都怪Kimi》
我是唐辰同学,关注互联网科技及AI新经济。原创内容,未经许可,谢绝转载。
「唐辰同学」
钛媒体、36氪、老虎财经热榜
澎湃新闻2024年度最澎湃创作者
老虎财经2024年度优秀专栏
河南日报·顶端新闻2024年度影响力作者
界面新闻优质榜单
老虎财经2024年度优秀专栏
腾讯新闻年度优质热问答主
2023搜狐新闻年度优质创作者
人人都是产品经理2023年度优秀作者
2023网易新闻年度内容合伙人
界面、36氪、钛媒体、澎湃、21财经、蓝鲸、老虎财经等平台专栏认证作者
文章配图-1









