Kimi K3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签!知情人士:其估值可能超300亿美元

wap (13) 2026-07-22 00:50:04

每经记者|李宇彤    每经编辑|何小桃    

记者|李宇彤

编辑|何小桃 杨军 杜恒峰 校对|金冥羽

Kimi K3发布后的第四日,风暴仍在持续。

4天前(7月17日)凌晨,2.8万亿参数的K3横空出世,以1679分登顶Frontend Code Arena榜单,首次有开源模型在Frontend Code Arena前端编程榜单超越一众闭源模型登顶。特斯拉CEO(首席执行官)埃隆·马斯克在相关评测下留言:“Impressive(令人印象深刻)。”这是马斯克继今年3月点赞Kimi底层架构技术报告后第二次公开认可这支中国团队,并在其预告新模型Grok 4.6时,甚至将Kimi K3作为对比目标。

而赞誉的另一面是风暴。发布48小时后,Kimi发文表示用户请求量已大幅超出其预估,并且逼近现有集群的承载极限,Kimi宣布暂停C端新用户订阅,有业内观点将此次事件类比为“DeepSeek 2.0时刻”。

与此同时质疑声起,一方面有外界流传K3蒸馏模型的言论;另一方面人工智能公司OpenAI战略未来负责人迪恩·鲍尔也公开发帖抨击Kimi K3模型。他一方面承认K3性能无法依靠蒸馏实现,另一方面表示开放权重模型会削弱前沿模型的商业回报,称其为“减速主义力量”。

技术原创性争议、开源闭源路线之辩、高定价策略的可持续性,三重追问投向月之暗面公司,该公司企业业务负责人黄震昕直面媒体,首度系统性回应外界质疑。

否认“K3是蒸馏小模型”

“性能跃升来自底层原创架构创新”

针对外界流传的“K3是蒸馏小模型”的猜测,7月21日上午,月之暗面公司企业业务负责人黄震昕在接受媒体记者采访时直接否认。黄震昕表示,K3性能跃升的核心来自底层原创架构创新,并非对现有模型蒸馏复刻。

此前发布时,Kimi也提到架构层面变化带来的效率提升。据介绍,Kimi K3基于Kimi Delta Attention(KDA)混合线性注意力机制和Attention Residuals(AttnRes)注意力残差技术构建。MoE(混合专家)层面,模型在896个专家中激活16个。而上述结构性改进让Kimi K3 相比K2的整体扩展效率提升约2.5倍。

本次黄震昕进一步披露了支撑K3的三项关键技术。其中,Moon Clip是一种全新二阶优化器,由Kimi首次应用于大模型训练。“当前全球可用训练数据基本见底,这项技术能让20T训练数据跑出40T的训练效果,同等性能下训练成本、算力功耗直接减半。”Kimi Linear Tension是其自研线性注意力机制,用于解决传统线性注意力处理超长任务时性能衰减的痛点。“行业存在AI摩尔定律,AI可执行任务时长每7个月翻1倍;这套机制让上下文窗口扩大10倍,训练成本仅同步扩大10倍。”

今年3月发布技术报告时已引起过一次关注的Attention Residuals(注意力残差),这项技术优化了模型多层网络间信息传递与复用逻辑,它让2.8万亿超大参数模型既能稳定完成训练,又能让推理效率同步提升25%。

今年以来,月之暗面创始人杨植麟曾多次在公开演讲中提及Kimi构建规模化策略Token(词元)效率、长上下文、Agent(智能体)集群,在有限资源下实现智能最大化。而从当前Kimi技术迭代方向来看,团队仍坚定不移地走既定路线,专注编程、金融、法律、科学研究等生产力场景。

关于模型幻觉问题,黄震昕也作出了回应。他表示,幻觉无法彻底根除。“幻觉本质是模型创造力的同源产物”,但K3已大幅压低其发生率;配套事实校验员子Agent的Agent Swarm架构,可逐一对报告、行业数据做校验,进一步降低内容失真概率。

面对开源闭源路线之争,黄震昕的观点清晰:二者并非对立竞争关系,而是企业客户差异化需求的产物。有私有化、微调需求的企业倾向开源,追求稳定托管服务的企业选择闭源。开源、闭源路线本身,与模型Token能力、输出质量没有必然绑定关系。

他同时明确,Kimi自K2起坚持开源路线,这一路线未来不会改变,核心底层技术、论文均对外公开,完整模型权重计划于2026年7月27日前发布。

Kimi K3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签!知情人士:其估值可能超300亿美元 (http://www.kingbaby.com.cn/) wap 第1张

用户请求量大幅超出预估

算力承压的Kimi要做取舍

K3上线的火爆程度超出所有人的预判,包括月之暗面。黄震昕坦言团队提前做了流量预案,但实际访问量的暴涨幅度远超预期。

发布后48个小时,Kimi在7月19日深夜紧急发布公告,表示其面临始料未及的算力挑战,用户请求量已大幅超出预估,并且逼近现有集群的承载极限。

黄震昕表示,当时公司面临两难,放开全部新用户注册,会严重损害存量付费老用户的使用体验;优先保障付费客户,则需临时限制新用户注册。公司选择了后者。“宁可暂时放弃新增收入,也要守住付费客户的使用体验底线。”

7月19日,月之暗面正式公告暂停C端新用户订阅,将已有算力全部投入服务已订阅用户,同时全速推进算力扩容。在新算力陆续到位,再逐步开放更多订阅名额直至全面恢复正常订阅。根据Kimi官方回复内容,目前老套餐没有被移除,当前用户可正常使用并自动续费;老用户可选择升级套餐。

《每日经济新闻》记者也就算力扩容落地时间规划、新增算力的规模等问题向公司方面发出提纲,但截至发稿暂无回应。

对于商业化层面,黄震昕透露,Kimi现阶段暂不提供私有化部署服务,商业模式对标海外成熟头部AI企业,核心发力打磨模型基础能力。他同时也表示不会止步于当前2.8万亿规模,大模型参数规模还会持续拓展。

本次随着模型能力一同受到关注的还有一路走高的模型价格。据第三方机构Artificial Analysis测算,Kimi K3单任务成本约0.94美元,与GPT-5.6 Sol的1.04美元接近,约为Claude Opus 4.8(1.80美元)的一半,定价已经将K3推向与海外头部模型同台竞技的价格带。“开源模型、中国大模型不该被贴上低价标签。我们做出了SOTA(State-Of-The-Art,最先进水平)级模型,也能匹配合理商业定价。”黄震昕说。

数据也成为这一观点的印证。此前7月18日,月之暗面总裁张予彤在社交媒体发布一张Kimi企业最新ARR(年化收入)的图表,图片显示Kimi K3于7月17日发布后,企业ARR有了数倍快速增长。

Kimi K3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签!知情人士:其估值可能超300亿美元 (http://www.kingbaby.com.cn/) wap 第2张

图片来源:张予彤小红书账号截图

《每日经济新闻》记者了解到,此前6月中旬,月之暗面的ARR已经突破3亿美元。

同一时间,黄震昕在公开演讲中表示,Kimi海外付费用户增长400%,API收入增长400%,产品进入200多个国家和地区,互联网、金融、制造、教育、医疗等行业正成为重要企业客户来源。

他也在谈及大模型行业发展现状时表示,当前赛道确实存在发展泡沫。黄震昕同时举例,海外头部厂商Anthropic已实现季度盈利,月之暗面也正向着这一方向赶超,“最终还是希望探索智能的上限,希望能和海外那3家模型公司掰掰手腕”。

风暴眼中,另一条消息也在发酵。据市场知情人士向《每日经济新闻》记者透露,头部大模型企业月之暗面已向投资人发送上市议案,预计最快6个月内有望完成港交所上市,估值可能超过300亿美元。目前公司方面对此暂无回应。

Kimi K3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签!知情人士:其估值可能超300亿美元 (http://www.kingbaby.com.cn/) wap 第3张

月之暗面创始人杨植麟,图片来源:每经媒资库,资料图

K3引发的连锁反应远未结束,中国大模型正在全球市场成为新的价值标杆。7月18日,马斯克宣布xAI正在训练参数规模达2万亿的Grok 4.6,“将在下周完成首轮训练,有可能超越Kimi。”月之暗面随后在社交媒体上回应:“欢迎加入“2万亿+”俱乐部。”本次黄震昕也表示:“可能这次的这个(K3)表现,(让他们)得到一点震撼的感觉,现在拭目以待,希望他们出来跟我们掰一掰手腕。

当开源模型第一次站到编程能力的世界之巅,并向海外头部闭源产品的价格带看齐时,真正的考验才刚刚开始。撕掉“低价”标签之后,如何在开源的开放姿态与商业的合理回报之间找到平衡,让SOTA级的技术能力兑换成可持续的定价权,还需要Kimi和所有中国开源玩家不断探索。

(免责声明:文章内容和数据仅供参考,不构成投资建议。投资者据此操作,风险自担。)

Kimi K3火了,月之暗面回应争议:并非蒸馏复刻现有模型,国产AI不该被贴上低价标签!知情人士:其估值可能超300亿美元 (http://www.kingbaby.com.cn/) wap 第4张

|每日经济新闻  nbdnews  原创文章|

未经许可禁止转载、摘编、复制及镜像等使用

THE END