参与K3开放权重讨论,技术报告能否回应Claude蒸馏质疑?

参与K3开放权重讨论,技术报告能否回应Claude蒸馏质疑?

7月27日晚间,Kimi K3开放日活动如期举行。月之暗面不仅公开了Kimi K3模型的权重与技术报告,还同步开源了三项关键基础设施:针对超大规模MoE通信的MoonEP、面向线性注意力的FlashKDA,以及服务于长周期智能体强化学习的AgentEnv。

随着热度发酵,外界对K3的讨论逐渐深入,开始触及更棘手的问题:这些公开内容能否真正解释K3为何突然变强?它们又能否帮K3摆脱“蒸馏Claude”的嫌疑?

严格界定,K3此次属于开放权重,并非完全意义上的开源。但凭借2.8万亿总参数和约1042亿激活参数,它依然是当前规模最大、能力最逼近闭源旗舰的开放模型之一。

这份技术报告的发布时机颇为关键。

此前,Anthropic及部分美国官员指控月之暗面大规模获取Claude输出,并将相关能力用于Kimi训练。对此,中国商务部回应称,美方关于蒸馏和窃取知识产权的说法缺乏事实与法律依据,反对以此为由调查或制裁中国AI企业。

争议焦点不在于K3是否使用了蒸馏——这在行业里已是常规操作——而在于,K3是否通过工业级手段蒸馏了Claude最新模型的海量数据。

如今,月之暗面首次较为系统地展示了K3的技术全貌:更大的混合专家模型、重构的注意力与残差结构、百万Token的智能体强化学习,以及覆盖通用任务、智能体和编程任务的九大专业策略。

图片来自AI生成

**K3为何能实现性能跃升?**

Kimi K3基于混合专家架构,总参数量达2.8万亿。模型内部设有896个路由专家,每个Token会从中挑选16个,并调用两个共享专家,实际激活参数约为1042亿。

对比拥有1.04万亿总参数、326亿激活参数的Kimi K2,K3将模型总容量扩大了近2.7倍,单次计算调用的参数也增加了两倍以上。

规模扩张是解释K3能力提升的最直接因素,但月之暗面并未止步于堆砌参数。

K3采用3∶1的比例组合Kimi Delta Attention与Gated MLA。前者以较低缓存成本处理长上下文,后者定期执行全局信息交互,从而在效率与能力间取得平衡。这种混合结构使K3的原生上下文窗口扩展至约100万Token。

Attention Residuals旨在解决深层模型中的信息稀释问题。传统模型主要逐层传递信息,而K3可选择性地调用早期网络区块的表示,让重要信息更直接地影响后续计算。

Stable LatentMoE进一步扩大了专家空间,同时仅让少数专家参与每次计算。这既增加了知识容量,又避免了全部2.8万亿参数同时运行。月之暗面指出,K3相较K2实现了约2.5倍的整体扩展效率提升。

一位业内人士分析,这些技术并未消除复杂性,而是将其转移至底层AI Infra。更多专家意味着更难的跨卡调度;KDA虽减轻了长上下文的缓存压力,却引入了新的递归状态;Attention Residuals则增加了跨层信息的保存与传递。因此,AI Infra层的压力实则更大。

为此,月之暗面同步开放了MoonEP和FlashKDA。前者负责平衡超大规模MoE中的专家负载,后者助力KDA在GPU上高效运行。这意味着K3的效率不仅存在于模型权重中,更依赖于Kernel、通信、缓存及集群调度的协同。

权重开放后,这套系统已接受外部工程验证。例如,昇腾在7月28日宣布对K3进行0day适配,覆盖训练、推理、显存优化及MXFP4等数值格式;vLLM、SGLang和TokenSpeed也已提供支持。

不过,开放仅一天,社区多处于调试阶段,尚未独立复现其2.5倍扩展效率、百万Token吞吐及长周期智能体表现。

因此,尽管技术报告提供了解释能力增长的架构蓝图,但部分关键结论仍源自月之暗面的内部实验。

**九个专业模型,如何塑造一个K3?**

相比基础架构,K3的后训练流程或许更能解释其在编程和智能体任务上的突破。

据技术报告,月之暗面先通过监督微调建立冷启动模型,随后在通用任务、通用智能体和编程智能体三个方向进行强化学习。每个方向分别训练low、high和max三档推理强度,由此形成九个专业教师策略。

最终,这九个专业模型通过多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation,MOPD),合并为统一的K3。

所谓“在线”,指学生模型并非简单模仿教师预先生成的答案。学生先按自身策略生成任务轨迹,再由相应领域和推理强度的教师提供反馈。这种方式更贴近学生模型的实际运行状态,有助于整合九套不同策略。

多教师在线蒸馏并非K3首创。公开资料显示,小米MiMo团队在2025年12月发布MiMo-V2-Flash时,已明确使用并命名了MOPD;多教师知识蒸馏和在线蒸馏的基础思路出现得更早。

K3的创新点不在于首提MOPD,而在于将其应用于由三个任务领域和三档推理强度组成的九教师体系。需明确区分的是,技术报告中的MOPD与美国方面指控的Claude蒸馏并非同一概念。

根据披露流程,MOPD阶段的直接教师,是由K3冷启动模型经分领域强化学习形成的内部专业策略。报告未将Claude或Fable列为该阶段的教师。

由于技术报告未完整披露预训练语料、监督微调数据、奖励模型数据和合成任务的来源,无法彻底证明外部模型输出从未进入K3的训练流程。

独立评测显示,K3在Frontend Code Arena等评测中领先,在部分智能体和编程基准上接近或超过Claude、GPT系列;但在DeepSWE、FrontierSWE及部分综合知识工作评测中,仍落后于Claude Fable 5或GPT-5.6 Sol。

**开放解释了增长,却未还原数据来源**

今年2月,Anthropic声称月之暗面、DeepSeek和MiniMax通过大量虚假账户及代理渠道获取Claude输出。三家公司累计产生超1600万次交互,其中月之暗面相关活动超340万次,目标涵盖智能体推理、工具调用、编程、数据分析、计算机操作和计算机视觉。

美国白宫科技政策办公室主任Michael Kratsios近日表示,美方掌握信息显示,月之暗面曾蒸馏Anthropic的Fable模型用于K3开发。围绕“工业级蒸馏”的调查、制裁及实体清单措施,也被美国官员提上议程。

中国商务部在7月27日直接回应,指出美方忽略了中美模型发布时间间隔短、中国模型已具备领先能力等事实,并称有关说法缺乏证据和法律依据。商务部强调,模型蒸馏是行业普遍技术,美国企业也在研究利用中国开放模型。

上述行业人士认为,Fable 5公开可用与K3发布之间时间极短,要在如此短时间内完成海量数据获取、后训练、评测和产品部署,并据此解释K3的全部能力,不符合超大模型通常的研发周期。

开放权重本身也无法给出确切答案。2.8万亿参数的Stable LatentMoE、KDA与Attention Residuals、九教师MOPD、百万Token强化学习,以及MoonEP、FlashKDA和AgentEnv,共同构成了一条相对完整的能力增长路径。

月之暗面展示了一套足以生产前沿模型的架构、算法和基础设施,但尚无法自证清白,摆脱蒸馏陷阱的质疑。