7月17日凌晨,月之暗面扔出了一颗炸弹。
Kimi K3。总参数量2.8万亿,上下文窗口100万token,原生支持视觉理解,7月27日前开源。
朋友圈和技术群里瞬间刷屏。有人说这是国产大模型的封神之作,有人说月之暗面终于正面硬刚Claude和GPT了。
但我的第一反应不是兴奋。是紧张。
2.8万亿参数确实是个让人咋舌的数字。可数字背后,月之暗面真正的处境是什么?
坦率地讲,这不是一张成绩单。更像一张赌桌前的最后一把all in。
先把时间线往回拉。
你看出来了吗?月之暗面的节奏在加快。
K1.5到K2.5用了将近一年,K2.5到K3只用了不到半年。模型规模从1万亿参数直接跳到2.8万亿。融资一轮接一轮,估值从200亿飙到315亿。
这种加速感,不像是胸有成竹的扩张。更像是被什么推着跑。
先说技术。
K3的2.8万亿参数不是简单的堆料。月之暗面做了几件事,确实值得认真对待。
第一项是KDA(Kimi Delta Attention)。传统注意力机制在处理长文本时,计算量随文本长度平方级增长。KDA的做法是把长上下文拆成"已总结的历史"和"新来的变化",对历史部分用线性方式维护紧凑记忆,新token只重点关注变化部分。官方说在百万token场景下,解码速度最高提升了6.3倍。
第二项是Attention Residuals。在深层网络里,信息从底层传到顶层会逐渐衰减。AttnRes增加了专门的残差连接,让每一层的注意力输出可以更直接地"跳过"中间层。训练效率提升约25%,额外成本不到2%。
再加上896个专家里只激活16个的MoE架构,K3的扩展效率比K2提升了约2.5倍。
从官方公布的测试数据看,K3在多个编程基准上已经进入全球第一梯队。Program Bench得分77.8,略高于Claude Fable 5的76.8。SWE Marathon拿下42.0分,超过了GPT-5.6 Sol的39.0分。
K3在FrontierSWE上获得81.2分,虽然低于Fable 5的86.6分,但已超过GPT-5.6 Sol的71.3分。这说明它在需要创新性解决的难题上找到了自己的位置。不是全面超越,是局部突破。
但问题来了。
2.8万亿参数对本地部署提出了极高要求。月之暗面建议至少采用包含64个加速器的超级节点来部署K3。
普通开发者?消费级设备?别想了。
这更像是一个面向云端的"可访问开源",而非真正的本地可运行开源。月之暗面承诺开放完整模型权重,但能跑起来的机构,国内屈指可数。
那么问题来了,如果普通开发者跑不动,开源的意义在哪?
月之暗面之前不是没走过开源路线。但之前的态度是,核心模型闭源,通过API和产品变现。
K3突然宣布开源,而且是在发布后两周内就开放权重。这个节奏,不像深思熟虑的战略转向。
像被逼的。
被谁逼?DeepSeek。
2025年初DeepSeek R1的开源,是中国AI行业的一个转折点。它证明了一件事,开源模型可以做到接近顶级闭源模型的能力,而成本只有几十分之一。
DeepSeek之后,国内大模型的竞争逻辑变了。以前大家拼的是谁的产品体验好、谁的C端用户多。现在多了一个维度,谁的开源社区影响力大、谁的模型被更多开发者自发采用。
月之暗面在这个维度上,一直是落后的。
DeepSeek的GitHub星数、社区讨论热度、第三方集成数量,都远超Kimi。更关键的是,DeepSeek的开源策略让它成为了中国AI的"事实标准"——很多企业和开发者默认用DeepSeek做底座,而不是Kimi。
月之暗面想扭转这个局面。K3开源,就是它扔向DeepSeek的一枚重磅炸弹。
但这里有一个悖论。
如果K3真的开放到任何人都能用,那月之暗面的API收入怎么办?API收入现在占它总收入的七成以上。如果开发者都自己去部署开源模型了,谁还付费调用API?
如果K3的开放只是名义上的——比如需要超级集群才能跑,普通开发者根本碰不到——那开源的社区影响力又从何而来?
月之暗面走在一条钢丝上。左边是闭源产品的商业化,右边是开源社区的生态扩张。K3的选择,是往右边倾斜了一点。
但倾斜多少,它自己可能也没想清楚。
很多报道把K3和Claude Fable 5、GPT-5.6 Sol放在一起比较,标题写着"正面硬刚国际顶级模型"。
这种比较有道理,但模糊了真正的竞争格局。
K3在编程基准上接近甚至部分超越了Fable 5和GPT-5.6 Sol,这确实是中国大模型的一次突破。但月之暗面现阶段最大的威胁,不是Anthropic或OpenAI。
是DeepSeek。
为什么?因为Anthropic和OpenAI主要市场在海外,和月之暗面的直接竞争有限。但DeepSeek和月之暗面在同一个市场、同一批客户、同一个生态位上抢食。
企业客户选择大模型底座时,如果DeepSeek开源、成本低、社区活跃,而Kimi闭源、价格更高,选择倾向是很明显的。
K3的API定价也说明了月之暗面的焦虑。缓存命中的输入价格是每百万token 0.30美元,未命中缓存的输入3美元,输出15美元。按人民币算,输出约100元每百万token。
这个价格远高于GLM-5.2的输入8元、输出28元。
月之暗面的解释是,K3以更高推理强度、更长任务执行时间为卖点,切入高端市场。但说实话,在DeepSeek把价格打到地板以下的市场里,喊高端定位是需要勇气的。
杨植麟相信Scaling Law。从K2的1万亿参数到K3的2.8万亿,不到一年时间规模翻了近三倍。
这种信仰很纯粹。但市场开始怀疑了。
GPT-5.6 Sol是基于强化学习持续优化的老架构,Fable 5和K3都是全新预训练的新一代模型。GPT-6一旦发布,技术代差可能再次拉开。
更重要的是,参数规模的边际效益在递减。从1000亿到1万亿,能力跃迁很明显。从1万亿到2.8万亿,提升幅度在收窄。训练成本却在指数级上升。
K3的训练成本月之暗面没有公布,但按照行业惯例,2.8万亿参数的MoE模型,训练一次的花费可能在数千万到上亿美元级别。
月之暗面年内已完成多轮融资,最新投前估值315亿美元。ARR 3亿美元,看着不错,但和估值比起来,收入倍数仍然很高。
资本市场对AI公司的耐心是有限的。如果K3不能带来足够的商业化回报,下一轮融资的压力会很大。
回到开头那个判断。
Kimi K3是不是一个好模型?是。2.8万亿参数、KDA架构、编程能力进入全球第一梯队,这些都是实打实的成绩。
但它是不是月之暗面的"封神之作"?我不这么认为。
封神之作应该是定义规则的,不是追赶规则的。K3在很多方面还在追赶——追赶Claude的编程能力,追赶DeepSeek的开源影响力,追赶GPT的品牌认知。
月之暗面的真正挑战,不是下一版模型能不能再多1万亿参数。是找到一个属于自己的、别人抄不走的生态位。
在做到这一点之前,每一代Kimi的发布,都是背水一战。
杨植麟把大模型比作"绵延而未知的雪山"。那K3就是他攀到的又一个营地。山顶还远,氧气越来越稀薄。
而身后的DeepSeek,已经追到同一个营地了。
谢谢你看我的文章。
文中所涉数据均来自月之暗面官方披露及公开报道,API价格与测试数据截至2026年7月17日。