引发硅谷震撼的中国Kimi K3,成功的秘密在4个月前杨植麟的演讲中

大模型竞技场的王座正在被开源力量以惊人的速度改写。 中国人工智能新贵月之暗面日前正式发布了其全新的开源旗舰模型Kimi K3,一举登顶全球前端代码等多项权威基准测试排行榜。

在这场技术奇袭的背后,四个多月前月之暗面首席执行官杨植麟在英伟达GTC大会上的一场硬核演讲,恰好为全行业提供了一份解构Kimi K3技术密码的终极路线图。 在那场全程聚焦于算法底层的技术分享中,杨植麟毫无保留地阐述了团队针对大语言模型进行“三维扩展”的核心技术野心。

在英伟达顶级GPU集群算力日益昂贵、高质量互联网文本逐渐撞击“数据墙”的二零二六大背景下,月之暗面并没有盲目跟随硅谷堆砌参数的旧路。 他们选择在优化器、长上下文架构以及智能体蜂群三大前沿维度上进行饱和攻击,最终用Kimi K3交出了一份颠覆封闭派行业叙事的完美答卷。

从二阶正交优化到线性注意力:怎么把每个Token的含金量推向极限

在传统的大模型预训练流程中,二零一四年诞生的Adam优化器一直被整个行业奉为不可动摇的黄金基石。 但杨植麟团队在预训练的第一维度Scaling Law上,破天荒地用自研的二阶优化器Muon全面替代了AdamW,实现了模型训练效率的跨代跃升。

Muon优化器的核心魔力在于,它在每一次梯度更新时,都会通过严密的数学转换让更新的每一项彼此保持绝对正交。 在相同参数量和相同训练数据的对照实验中,这种正交更新机制能够让大模型的Token利用效率凭空暴增一倍。

为了将这一饱含不确定性的二阶优化器成功扩展到一万亿参数的超大规模训练中,团队甚至创造性地开发出了QK clip技术。 该技术在网络前向传播中动态计算每一个注意力头的最大数值,并据此施加精确的缩放系数,生生将暴涨的对数几率限制在安全范围内,彻底解决了万亿级训练中Loss爆炸发散的行业黑洞。

在第二维度上下文长度的扩展上,团队直接向统治了行业八年之久的传统注意力机制开刀,推出了独创的Kimi Linear架构。 传统全注意力机制的键值缓存(KV缓存)会随着文本长度呈二次方线性暴涨,极大地拖慢了长文本推理的整体处理速度。

而Kimi Linear引入了一种被称为Kimi Delta Attention(简称KDA)的全新混合线性注意力变体。 它将原本单一的标量衰减系数升级为高维的对角矩阵,从而赋予了模型在长程上下文中有选择性地清除陈旧信息、保留核心摘要的“海马体”记忆能力。

通过将线性注意力层与全注意力层按一比三的精妙比例进行交错混合编码,并重写全套矩阵求逆计算公式以适配现代GPU的分块并行计算。 Kimi K3不仅在短上下文任务上超越了老牌架构,更在百万级别超长文本输入和长输出任务上实现了算力消耗与表达能力的双重降维打击。

智能体蜂群与联合强化学习:多模态早期融合催生的终极形态

除了在单一模型的架构上剥茧抽丝,月之暗面在第三维度上祭出的“智能体蜂群”(Agent Swarm)训练范式,则是将AI从单兵作战推向组织化协同的杀手锏。 团队专门为该系统设计了一个高智商的“主编排者”角色,它能够像人类社会里的企业CEO一样,将复杂的终极任务拆解并分发给并行运转的子智能体。

为了防止模型在强化学习训练早期退化为低效的单兵串行模式,团队在基础设施底层构建了精密的“三项奖励加总优化目标”。 系统通过实例化奖励鼓励大量派生子智能体,通过完成奖励确保每一个子任务不被半途而废,再结合最终的结果奖励,让上百个子智能体在可接受的时间范围内实现高效的并行数据分析与文献综述输出。

这种强先验、长上下文与蜂群战术的精妙融合,在Kimi K3的多模态预训练阶段催生出了令人惊叹的互增强涌现效应。 不同于西方主流模型先文本、后视觉的后期叠加做法,Kimi K3在进度为零的第一天就将视觉和文本Token混在一起进行了激进的“早期融合”训练。

实验数据表明,纯粹的视觉强化学习任务不仅没有拖累文本表现,反而奇迹般地带动了偏重逻辑推理的纯文本任务指标大幅攀升。 反过来,由于文本基座足够硬核,团队在行业内首创了Zero Vision SFT技术,即在完全不准备任何专门视觉微调数据的情况下,仅凭强悍的文本SFT和联合强化学习,就让Kimi K3的视觉设计和前端编程能力做到了全球顶尖水平。

在演讲的尾声,杨植麟甚至放出了一项更为科幻的“注意力残差”下一代架构预告,试图将时间维度的注意力机制旋转九十度,直接搬到网络的深度维度上,将Token效率再次无痛提升了百分之二十四。 随着月之暗面明确表示Kimi K3将在未来数日内全面对全球开源,那些妄图依靠高昂资本支出和闭源围墙来永远躺赚的硅谷老牌科技巨头们,注定将在这一发来自东方、融汇了极致数学改写与开源长鞭的“电磁重炮”面前,迎来整个商业叙事防线的彻底动摇与重新洗牌。

展开阅读全文

更新时间:2026-07-21

标签:科技   硅谷   中国   秘密   注意力   模型   文本   维度   蜂群   团队   架构   智能   正交   线性

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top