中国 Kimi 大模型背后的 CEO 表示:AI 竞赛的关键并不是谁拥有最多资源。
“真正稀缺的资源不是芯片,而是洞察力(Insights)。”
Moonshot AI(月之暗面)创始人杨植麟详细披露了他们如何依靠开源模型与 GPT、Claude 正面竞争的技术路线。在美国头部实验室逐渐减少技术公开分享的时候,他们选择了另一条道路。
第一步,他们放弃了整个行业自 2014 年以来广泛使用的 Adam 优化器。
Moonshot AI 开发的 Muon 优化器变体,可以用约一半的 FLOPs(浮点运算量)达到相同的训练损失(Loss),同时实现两倍的 Token 效率。这意味着在相同算力条件下,模型能够学习更多内容,或者用更少资源达到同样效果。
第二步,他们优化的不仅仅是模型损失函数(Loss),而是“每个 Token 位置对应的 Loss”。
杨植麟认为,优秀的模型架构不应该随着上下文长度增加而逐渐失去能力,而应该在更长的上下文中持续提升理解和推理能力。而这恰恰是 AI Agent 时代最重要的竞争核心——谁能在超长上下文中保持更强的推理和执行能力,谁就更有优势。
第三步,他们解决了大规模训练过程中长期存在的不稳定性问题。
在超大规模训练时,Loss 曲线经常会出现突然飙升(Spike),导致训练效率下降甚至失败。Moonshot AI 采用了一项名为 QK-Clip 的技术,在长达 15 万亿 Token 的训练过程中,让 Loss 曲线始终保持平稳,没有出现任何异常波动。
杨植麟甚至表示,这是他在 2025 年见过“最美丽”的技术成果之一。
第四步,他们正在推进下一代模型 K3 所使用的 Kimi Linear 技术。
这是一种线性注意力(Linear Attention)机制。长期以来,线性注意力虽然理论上效率更高,但效果始终无法超越传统的全注意力(Full Attention)架构。
而 Moonshot AI 认为,他们终于实现了突破。在处理超长文本任务时,Kimi Linear 的性能已经超过传统全注意力机制,并且在百万 Token 上下文场景下,速度最高可提升 6 倍。
第五步,开源并不是一种慷慨行为,而是一种战略。
杨植麟认为,每一次开源发布都会推动整个行业建立在他们的技术成果之上。随着越来越多开发者和企业采用这些模型,中国开源大模型正在逐渐成为全球 AI 生态中的默认选择之一。
据美股投资网 TradesMax.com ,最后,他用一句话概括了这一切:
“构建一个模型,本质上是在构建一种世界观(Worldview)。”
而到了最后,真正决定模型高度的,往往不是参数规模,也不是算力投入,而是创造者的品味(Taste)。
观看并收藏这段分享。
这是迄今为止最清晰的一次机会,让人们了解 Kimi 团队究竟是如何思考 AI,以及他们为何能够在资源远不如美国科技巨头的情况下,持续与 GPT、Claude 等顶级模型展开竞争。












