Kimi K3号称全球最大开源模型?

7月16日,世界人工智能大会(WAIC)开幕前夕,月之暗面扔出一枚重磅模型:Kimi K3。2.8万亿参数、100万token上下文、原生支持视觉理解,官方给它的定语是“全球参数最大的开源模型”。

数字很唬人。但“最大开源”这四个字,经不起细抠。这篇文章试着把它拆开,看看到底是实打实的工程突破,还是又一轮参数军备竞赛的话术。

2.8万亿,到底是个什么概念

先说参数规模。K3的总参数量是2.8万亿(2.8 trillion),这是目前公开的开源权重模型里最高的。上一个纪录保持者是 DeepSeek V4 Pro,约1.6万亿参数,也就是说,K3在参数总量上比它大了大约75%。月之暗面还放话说,过去12个月里有9个月,Kimi系列都守着开源模型参数规模的天花板。

但这里有个关键陷阱:K3是MoE(混合专家)架构,896个专家子网络里,每次前向推理只激活16个。所以“2.8万亿”是总容量,不是每次推理都要算一遍的算力。你花的钱、烧的卡,对应的是那16个被激活的专家,而不是全部。换句话说,参数总量更像是一个“能力上限”的指标,而不是单次推理成本的指标。

这就引出一个问题:拿总参数量去定义“最大”,到底在比什么?比的是模型的容量天花板,不是推理时的实际开销。这一点后面会反复出现。

真正值得看的是架构

如果只盯着参数数,容易错过K3真正有意思的地方。月之暗面这次主推的,是两套新的注意力机制。

第一套叫 Kimi Delta Attention(KDA),一种混合线性注意力。传统Transformer的注意力随序列长度二次增长,到了百万token级别,解码速度会崩。KDA官方宣称在百万token上下文里把解码速度提升到最高6.3倍。第二套叫 Attention Residuals(AttnRes),作用在“深度”维度上,选择性地跨层检索表征,而不是均匀地逐层累加,据说能换来约25%的训练效率提升,额外成本不到2%。

稀疏化是第三根支柱。Stable LatentMoE 在2.8万亿这个量级上保持专家路由稳定,配套的 Quantile Balancing 直接根据路由分数的分位数分配专家,干掉了过去那种靠启发式调参、对超参数极敏感的均衡逻辑;Per-Head Muon 把优化细化到每个注意力头;再加上 SiTU 激活函数和 Gated MLA。一整套组合拳下来,官方说整体扩展效率比上一代K2提升约2.5倍。

工程侧也有讲究:从SFT阶段就开始量化感知训练,权重用MXFP4、激活用MXFP8,目的是兼容更广泛的硬件;推理上建议用64张以上加速器组成的“超级节点”,并给vLLM社区贡献了适配KDA的前缀缓存实现。这些细节说明,月之暗面想解决的不只是“把模型做大”,而是“把大模型跑得起、跑得便宜”。

性能:到了哪一档

benchmark层面,K3的表现可以概括为一句话:摸到了一线闭源模型的门槛,但还没翻过去。

在 Artificial Analysis 的 Intelligence Index 上,K3得分57,在189个模型里排第4,和 Claude Opus 4.8、GPT-5.5 处在同一梯队,落后的是 Claude Fable 5 和 GPT-5.6 Sol。前端编程榜单 Arena AI 的 Frontend Code Arena 上,K3以1679分拿了第一,压过 Fable 5(1631)和 GPT-5.6 Sol(1618)。

代码类任务里,它和 Opus 4.8 的对比更鲜明:DeepSWE 67.5 对 59.0,FrontierSWE 81.2 对 66.7,BrowseComp 91.2 对 84.3。但换个榜就不是这样了——FrontierSWE 上它输给 Fable 5(81.2 对 86.6),HLE-Full 上也落后;GPQA-Diamond 拿了93.5,领先 Opus 4.8,却又被 GPT-5.6 Sol 的94.1压了一头。

值得肯定的是,月之暗面自己把话说得很明白:“整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol。”这种不给自己灌水的陈述,在厂商发布里不多见。结论相对清晰:K3在编程、智能体等一众评测里追平甚至超过部分现役闭源模型,但在综合最强项上仍有差距。

“开源”两个字,先打个问号

回到标题那个问号。

严格说,K3现在还不是完全开源。月之暗面的计划是:完整模型权重在2026年7月27日前发布。也就是说,截至本文写作时(7月22日),权重还没放出来,训练和推理代码、数据配方、技术报告也都还在“即将披露”的状态。

这就牵出“开源”和“开放权重”的差别。真正的开源大模型,通常意味着权重、训练代码、数据管线、评测方法都公开,社区能复现、能改。而“开放权重”只保证你能拿到模型文件本地部署、自行微调,至于怎么训出来的,未必透明。K3目前更接近后者,这也没问题,只是别把“开放权重”直接等同于“开源”。

另一个待解的问题是许可证。目前官方文档还没披露权重以什么协议放出,是宽松的 Apache-2.0 式,还是带商用限制的社区协议,直接决定了开发者能拿它做什么。对打算自托管或做产品的团队来说,这才是7月27日最该盯着的点。

当然,月之暗面给生态的诚意也有:主动给vLLM上游贡献适配代码,API兼容OpenAI SDK,开发者迁移成本很低。这比单纯扔一个权重文件要实在。

成本和怎么用

已经能跑的通道是 Kimi App、Kimi Work 桌面端、Kimi Code 终端智能体,以及 API。

价格方面:缓存命中的输入 $0.30/百万token,缓存未命中 $3.00/百万token,输出 $15.00/百万token。官方称在编程任务里缓存命中率能到90%以上,换算下来实际输入成本远低于标价。百万token上下文配上前缀缓存,对长代码库、长文档、多轮智能体会话很友好。

一个使用上的限制:目前 reasoning_effort 只支持 max 档,想调低思考力度还得等后续更新。另外官方提醒,从别的模型切到K3中途可能让生成不稳定,换模型最好开新会话。

它真正说明的事

把参数、架构、性能、开放程度放在一起看,K3的意义不在于“最大”这个头衔,而在于它把开源权重模型的能力天花板,推到了和一线闭源模型同一档的附近。

这在一年前还很难想象。过去开源模型常被视为闭源产品的“平替”或试验品,而K3在多个编程和智能体评测里已经能跟 Opus 4.8 正面掰手腕。MoE加稀疏注意力的路线,本质上是在算力受限的现实下,用架构和工程优化去换规模,这比单纯堆卡更符合大多数团队的实际处境。

至于“全球最大开源模型”这个称号,准确的说法应该是:它是目前参数规模最大的开放权重模型,且大概率会在7月27日之后成为可自托管的最大模型之一。但“开源”成色几何,要等权重和许可证落地才能盖棺定论。

对开发者而言,接下来两周值得做的,不是急着下结论,而是等权重放出后,在自己的真实任务上跑一遍,尤其是长程编程和深度研究这类K3主打的场景。榜单分数再好看,也不如你仓库里那次真实的构建通过来得实在。