中国 AI 的打法,已经换了内核

黄仁勋发了人生第一条推文,不推芯片,推的是一封公开信。

这事儿本身就值得琢磨。

一个在 X 上沉默多年的人,7月24日晚上突然开嗓,开口第一句话不是“我的芯片天下第一”,而是转了一封25家公司联名的公开信,主题就一个:

开源 AI 模型是好东西,国会老爷们千万别急着下死手限制。

签名名单上有英伟达、微软、Meta、IBM。美国科技圈的半壁江山,齐刷刷站队开源。

为什么是现在?

为什么黄仁勋憋了这么多年的第一条推文,给了这个话题?

答案藏在同一周的另一条新闻里。那几天,中国月之暗面的 Kimi K3,把完整权重挂上了 Hugging Face。

再往前数10天。

7月16日,K3上线几个小时,就在 WebDev Arena 编程盲测榜上登顶。注意这个定语,开源模型第一次在这个榜上压过所有闭源模型。

注意,是所有。

美国 AI 圈的知名研究者 Nathan Lambert 当场写下一句话,后来被反复引用:“frontier open-weight models are now real”。

翻译过来,前沿开源权重模型,这回是来真的了。

一句话,道破天机。

黄仁勋们急着喊话国会,不是良心发现爱上了开源精神,是发现开源这面旗,再不抢过来扛,就要被别人扛走了。

刚发布的那份47页技术报告,把 K3怎么做到的讲得明明白白。我给大家捋一捋,这事儿到底有多不一般。

先说一个反常识的判断。

大模型往哪儿变强,报告说有两条路。

一条是部署前砸算力,模型做得更大,数据喂得更多。另一条是部署后砸算力,让模型推理更久、反思更深、自己干活。过去两年,开源社区在后一条路上狂奔,前一条路上几乎原地踏步,绝大多数模型卡在1万亿参数这一档动弹不得。

K3的判断很直接,光练后半场,迟早被闭源甩开。

两条轴,得一起推。

一个多月前,DeepSeek V4的报告选了另一条路线,重新设计注意力,拼命压低成本,V4 Pro 总共1.6万亿参数,每个词只激活49亿。

K3反着来,2.78万亿总参数,每个词激活1042亿,激活量直接翻倍还多。

两份报告,隔空回话。

一个往精里做,一个往大里做。谁对?不好说。但敢这么公开叫板的,说明手里都有真家伙。

K3手里的家伙,数据上是这么写的:

相比上一代 K2,整体 scaling 效率提升约2.5倍。

2.5倍从哪儿来?拆开看,是三组改动叠出来的。

第一组,管词和词之间怎么交流。

传统注意力让每个词回头比对前面所有词,文本翻倍,计算量翻四倍。百万字的上下文?算力直接哭给你看。K3把四分之三的注意力层换成一种叫 KDA 的线性注意力,不逐词回翻,只维护一份固定大小的状态,计算量随文本长度线性增长。

怕线性注意力眼神不好,每三层 KDA 保留一层传统注意力兜底,3:1混搭。顺手还把位置编码整个扔了,不给词标座位号,让模型自己记顺序,于是100万 token 的上下文直接原生支持,不用事后打补丁。

第二组,管层和层之间怎么传话。

K3有93层。

过去十年,深度学习的规矩是每层只能看上一层递来的纸条,传到第93层,第1层算的账早稀释没了。K3搞了个叫 AttnRes 的东西,让每一层能主动翻前面所有层的笔记。

第90层想查第1层的原始作业?直接调阅,不用等层层转达。

第三组,管宽度。

模型里塞了896个专家子网络,每个词进来只调用16个,参数利用率不到2%。专家一多就容易乱,有的累死有的闲死。

传统做法是靠惩罚项纠偏,专家多到这个量级根本调不稳。K3换了思路,叫分位数均衡,直接看统计分布反推调度偏好,一次算完,还给了数学证明,理论上能做到完美均衡。

这个方法,是在 DeepSeek V3的方案上改的,方向是人家的,活儿干得更漂亮。

报告里坦荡承认了这些渊源。

MLA 注意力压缩来自 DeepSeek V2,不加辅助 loss 的路由策略来自 V3。但他紧接着干了件很有江湖气的事。

报告里有个案例,让模型去优化 GPU 核心算子,其中一个挑的是 DSA,DeepSeek 自家的招牌注意力算子。结果,K3把 DSA 的运行时间砍掉了55.1%。

自家的核心武器,被别人拿过去提速过半,还写进论文里给全世界看。DeepSeek 下一版要是不回应,怕是很难咽下这口气。

这就有意思了。

中国 AI 这两家,你拆我的招,我接你的力,技术报告写得一次比一次细,因为谁都清楚,我公开得越彻底,你踩着肩膀往上爬得就越快。这不是内卷,这是接力。

DeepSeek 拿掉辅助 loss,K3用分位数做得更精确;K3把 KDA 连带 kernel 和编译器 MiniTriton 一并开源,下一个团队就少走一大段弯路。

训练的排场也够大。

强化学习用的沙箱,训练评估期间一共创建了5120万个,存档133毫秒,恢复49毫秒。九个自研教师模型分头带徒弟,最后蒸馏回一个统一模型。BrowseComp 拿到91.2%,成本是 GPT-5.6 Sol 的一半。

Kimi Code Bench 上比 Claude Fable 5低4分,花费只有对方的38%。

还有一个细节,我读到的时候忍不住笑了。

Kimi 的 C 端因为算力紧缺,暂停了新用户订阅。产品火到限购,这在 AI 圈算不算一种新的凡尔赛?

怎么看?完全我个人看法,三点吧。

第一,开源闭源的攻守之势,真的在变。

过去几年的剧本是固定的,闭源站在山顶,开源在山腰吃土,差距按年算。现在呢?编程盲测榜上,开源把闭源挨个挑落马下,成本还只有人家的三分之一到一半。

当一个不要钱随便下载的模型,性能摸到最强闭源的脚脖子,闭源那道付费墙的根基就开始松了。Lambert 那句话之所以被疯传,是因为他说出了很多人不敢说的东西:

护城河,可能是个心理作用。

第二,美国的焦虑,写在黄仁勋的第一次里。

想想这个画面。中国开源模型登顶的同一周,美国芯片之王的账号活了,转发的内容是求国会别限制开源。为什么怕限制?

因为限制开源,等于把全球开发者的生态位拱手让给中国的开源模型。

英伟达们心里门儿清,技术标准谁定,生态就在谁手里,钱就在谁手里。这道选择题,封是封不住的,只能下场跟着玩。黄仁勋的沉默年代结束了,结束在一个中国模型登顶的7月。

这个巧合,比任何社论都有说服力。

第三,中国 AI 的打法,已经换了内核。

早些年是追赶,别人开源什么我们学什么。现在是出题,K3给 DeepSeek 优化算子,DeepSeek 给 K3提供路线,两家你追我赶,顺手把脚手架全部开源,招呼全球开发者一起来盖楼。

这种打法的高明之处在于,模型本身会过时,但你开源的架构、算子、均衡方法会留在别人的代码里,变成行业标准的一部分。

DeepSeek 的下一版会不会用上分位数均衡和 KDA?更多开源模型冲更大规模的时候,会不会直接站在 K3公开的地基上?大概率会。

到那时候,隔空喊话的就不止这两家了。

技术竞争有个朴素的道理,封锁锁出来的,往往是自己的孤岛;开放开出来的,才是真生态。

7月16日那个晚上,盲测榜刷新的时候,没有发布会,没有礼花。但很多人都听到了,有什么东西裂开了一条缝。

缝的那一边,开源这两个字,正在长成一个谁也没法装作看不见的庞然大物。

展开阅读全文

更新时间:2026-08-01

标签:科技   打法   中国   内核   模型   注意力   算子   报告   美国   国会   位数   手里   线性

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top