这次数博会最让人眼前一亮的,当属中科曙光带来的 Power K 存算协同方案。
此前圈内就一直在讨论这款面向大模型时代的存算方案,今天完整看完后,只能说真没白来,这绝对是今年国产存储领域的一件大事。

为啥说它戳中了大模型的痛处?
不少开发者都吐槽,买了一堆高端显卡,结果大半算力都浪费在重复计算上,明明硬件够了,却跑不出想要的速度。
现在大模型上下文越来越长,智能体动不动就几十轮交互,背后的记忆成本水涨船高,关键问题在于,KV 缓存大量挤在 GPU 显存里,而 HBM 既贵又紧张,缓存根本放不下。

模型只能反复重新计算历史内容,相当于买了一堆显卡,却天天让它们重复做同一道题,大把时间都耗在这上面。
四级缓存池到底有多厉害?
中科曙光的 PileCache 直接把 GPU HBM、CPU 内存、本地 SSD 和分布式共享存储整合成四级缓存池。

热数据留在显存,温数据放进内存,冷数据转到 SSD 和分布式存储,KV 缓存还能长时间留存,新请求过来,已经算过的内容直接复用,只需要计算新增部分。
这就好比过去每个 GPU 都守着自己的小本本,现在曙光给整个集群建了一座共享记忆库。

长文本下单轮对话首 token 时延最高降低 98.5%,多轮会话降低超过 80%,高并发场景下 Token 吞吐量最高提升了 27 倍。
同样一批显卡,过去被重复计算拖住,现在能接更多请求,产出更多 Token,像智能客服、知识库、代码助手这类需要共享大量背景资料的业务,这笔账算下来太值了。

更难得的是,PyTorch 原生兼容主流的 LM cache,原来的推理技术栈不用大改,毕竟迁移一次伤筋动骨,能平滑接入才是真正懂落地。
中科曙光在存储领域本来就有硬实力,此前 PolarDB 刚包揽 RO500 全球生产型全节点、时节点两项第一,现在又把存储能力延伸到推理赛道,相当于把存储从数据仓库,改成了 Token 生产线上的加速器。

以后再看 AI 基础设施,不能只数显卡数量了,谁能让显卡少做废活,多产 Token,谁才真正握住了推理时代的效率密码。
更新时间:2026-08-31
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号