Kimi K3风暴持续:月之暗面黄震昕直面争议,中国开源大模型定价权突围战打响
2026-07-22 06:17:52未知 作者:徽声在线
Kimi K3发布后的第四天,行业内的讨论热度依旧不减,一场围绕技术实力与市场策略的风暴持续发酵。
四天前,即7月17日凌晨,拥有2.8万亿参数的K3大模型震撼登场,凭借1679分的高分一举夺得Frontend Code Arena榜单的榜首位置,这一成就标志着开源模型首次在该榜单上超越了众多闭源模型。特斯拉CEO埃隆·马斯克对此给予了高度评价,他在相关评测下留言称:“Impressive(令人印象深刻)。”这已是马斯克今年第二次公开认可这支来自中国的团队,早在3月,他就曾点赞Kimi的底层架构技术报告。而在马斯克预告新模型Grok 4.6时,更是将Kimi K3作为了对比的标杆。
然而,赞誉的背后往往伴随着争议。K3发布仅48小时后,Kimi官方就发布声明称,用户请求量已远超预估,逼近现有集群的承载极限,因此不得不暂停C端新用户的订阅服务。这一举动被业内部分观点类比为“DeepSeek 2.0时刻”,引发了广泛讨论。
与此同时,质疑声也不绝于耳。一方面,有外界传言称K3是蒸馏小模型;另一方面,人工智能公司OpenAI的战略未来负责人迪恩·鲍尔也公开发帖抨击Kimi K3模型。他虽然承认K3的性能无法通过蒸馏实现,但却认为开放权重模型会削弱前沿模型的商业回报,将其称为“减速主义力量”。
面对技术原创性争议、开源闭源路线之争以及高定价策略的可持续性等三重追问,月之暗面公司企业业务负责人黄震昕直面媒体,首次系统性地回应了外界的质疑。
否认蒸馏小模型传言,强调底层原创架构创新
针对外界流传的“K3是蒸馏小模型”的猜测,黄震昕在7月21日上午的采访中直接予以否认。他表示,K3性能的跃升主要得益于底层原创架构的创新,而非对现有模型的蒸馏复刻。
据黄震昕介绍,K3在架构层面进行了多项创新,包括基于Kimi Delta Attention(KDA)混合线性注意力机制和Attention Residuals(AttnRes)注意力残差技术构建。在MoE(混合专家)层面,模型在896个专家中激活16个,这些结构性改进使得K3相比K2的整体扩展效率提升了约2.5倍。
黄震昕还进一步披露了支撑K3的三项关键技术。其中,Moon Clip是一种全新的二阶优化器,由Kimi首次应用于大模型训练。这项技术能够在全球可用训练数据基本见底的情况下,让20T的训练数据跑出40T的训练效果,从而在同等性能下将训练成本和算力功耗直接减半。Kimi Linear Tension则是其自研的线性注意力机制,用于解决传统线性注意力在处理超长任务时性能衰减的问题。黄震昕表示:“行业存在AI摩尔定律,即AI可执行任务时长每7个月翻1倍;而我们的这套机制让上下文窗口扩大了10倍,同时训练成本仅同步扩大了10倍。”
此外,今年3月发布技术报告时已引起关注的Attention Residuals(注意力残差)技术也得到了进一步优化。这项技术优化了模型多层网络间的信息传递与复用逻辑,使得2.8万亿超大参数模型既能稳定完成训练,又能让推理效率同步提升25%。
黄震昕强调,月之暗面团队一直坚定不移地走既定路线,专注编程、金融、法律、科学研究等生产力场景,致力于在有限资源下实现智能的最大化。这一战略方向在Kimi的技术迭代中得到了充分体现。
关于模型幻觉问题,黄震昕也给出了回应。他表示,幻觉是模型创造力的同源产物,无法彻底根除。但K3已经通过技术手段大幅压低了其发生率,并配套了事实校验员子Agent的Agent Swarm架构,可逐一对报告、行业数据做校验,进一步降低内容失真的概率。
面对开源闭源路线之争,黄震昕的观点十分清晰。他认为,开源和闭源并非对立竞争关系,而是企业客户差异化需求的产物。有私有化、微调需求的企业更倾向于选择开源模型,而追求稳定托管服务的企业则更倾向于选择闭源模型。开源、闭源路线本身与模型的Token能力、输出质量没有必然绑定关系。
黄震昕还明确表示,Kimi自K2起就坚持开源路线,这一路线未来不会改变。公司将继续公开核心底层技术和论文,并计划在2026年7月27日前发布完整模型权重。
用户请求量远超预期,算力承压下的Kimi做出取舍
K3上线的火爆程度超出了所有人的预料,包括月之暗面团队自己。黄震昕坦言,团队虽然提前做了流量预案,但实际访问量的暴涨幅度仍然远超预期。
发布后48小时,Kimi在7月19日深夜紧急发布公告,表示面临始料未及的算力挑战,用户请求量已大幅超出预估,逼近现有集群的承载极限。
黄震昕表示,当时公司面临两难选择:如果放开全部新用户注册,会严重损害存量付费老用户的使用体验;而如果优先保障付费客户,则需要临时限制新用户注册。最终,公司选择了后者。“宁可暂时放弃新增收入,也要守住付费客户的使用体验底线。”
7月19日,月之暗面正式公告暂停C端新用户订阅,将已有算力全部投入服务已订阅用户,并全速推进算力扩容。公司计划在新算力陆续到位后,再逐步开放更多订阅名额直至全面恢复正常订阅。根据Kimi官方回复内容,目前老套餐没有被移除,当前用户可正常使用并自动续费;老用户也可选择升级套餐。
《每日经济新闻》记者也就算力扩容落地时间规划、新增算力的规模等问题向公司方面发出提纲,但截至发稿时暂未收到回应。
对于商业化层面,黄震昕透露,Kimi现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部AI企业,核心发力打磨模型基础能力。他同时也表示,公司不会止步于当前2.8万亿的参数规模,未来大模型参数规模还会持续拓展。
随着模型能力一同受到关注的还有一路走高的模型价格。据第三方机构Artificial Analysis测算,Kimi K3单任务成本约0.94美元,与GPT-5.6 Sol的1.04美元接近,约为Claude Opus 4.8(1.80美元)的一半。这一定价已经将K3推向了与海外头部模型同台竞技的价格带。黄震昕表示:“开源模型、中国大模型不该被贴上低价标签。我们做出了SOTA级模型,也能匹配合理商业定价。”
数据也印证了这一观点。此前7月18日,月之暗面总裁张予彤在社交媒体发布了一张Kimi企业最新ARR(年化收入)的图表,图片显示K3于7月17日发布后,企业ARR有了数倍快速增长。
图片来源:张予彤小红书账号截图
《每日经济新闻》记者了解到,此前6月中旬,月之暗面的ARR已经突破3亿美元。
同一时间,黄震昕在公开演讲中表示,Kimi海外付费用户增长了400%,API收入也增长了400%,产品已经进入200多个国家和地区,互联网、金融、制造、教育、医疗等行业正成为重要企业客户来源。
在谈及大模型行业发展现状时,黄震昕表示,当前赛道确实存在发展泡沫。但他同时举例称,海外头部厂商Anthropic已经实现季度盈利,月之暗面也正向着这一方向赶超。“最终还是希望探索智能的上限,希望能和海外那3家模型公司掰掰手腕。”
在风暴眼中,另一条消息也在悄然发酵。据市场知情人士向《每日经济新闻》记者透露,头部大模型企业月之暗面已向投资人发送上市议案,预计最快6个月内有望完成港交所上市,估值可能超过300亿美元。目前公司方面对此暂无回应。
K3引发的连锁反应远未结束,中国大模型正在全球市场成为新的价值标杆。7月18日,马斯克宣布xAI正在训练参数规模达2万亿的Grok 4.6,“将在下周完成首轮训练,有可能超越Kimi。”月之暗面随后在社交媒体上回应:“欢迎加入“2万亿+”俱乐部。”黄震昕也表示:“可能这次K3的表现让他们得到一点震撼的感觉,现在拭目以待,希望他们出来跟我们掰一掰手腕。”
当开源模型首次站到编程能力的世界之巅,并向海外头部闭源产品的价格带看齐时,真正的考验才刚刚开始。撕掉“低价”标签之后,如何在开源的开放姿态与商业的合理回报之间找到平衡,让SOTA级的技术能力兑换成可持续的定价权,还需要Kimi和所有中国开源玩家不断探索。
