最近 AI 行业刮起了一场新的竞赛风,不再比谁的模型参数多,而是比谁能把算力用得更彻底。OpenAI、谷歌、智谱、Deepseek 这些巨头都盯上了推理加速,背后的原因很简单:当模型竞争进入部署阶段,让模型更快更便宜地跑起来,才是活下去的关键。

不是每家公司都有资金重造芯片,于是一个千亿级的新市场正在崛起 ——AI 基础设施(AI Infra)。它的核心逻辑很实在:已经部署的数据中心和 GPU,本身还有巨大的优化空间。
赛道里的玩家已经赚得盆满钵满:Bastion 年收入增长 20 倍,估值从 21 亿美元涨到 130 亿美元;Fireworks7 个月估值翻 4 倍,达到 175 亿美元,年化营收突破 10 亿美元。最近开源推理引擎 VLLM 和 SGLane 宣布商业化,种子轮融资都超过 1 亿美元,背后聚集了 AI 产业所有巨头和顶级风投,一场强强对决正式拉开帷幕。

GPU 的利用率,成了硅谷最新的关键词,也带出了这个千亿级市场。
单台 NVIDIA H100 机柜采购成本约 400 万美元,若利用率仅 50%,每年将白白烧掉 200 万美元。这不是危言耸听,CMU 最近对 756 块 GPU 做了 31 天的细粒度监测,覆盖 A100、H100 到 B200 的六代产品,结果显示集群整体有近 20% 的执行时间和约 11% 的能耗被浪费在等待上,推理场景的浪费更夸张,Asher code 的负载有 65% 的能耗消耗在空转,OpenAI 的 Chat 类请求也达到 52%。

很多人以为 GPU 一直很忙,其实大多数时间它都在闲等着。从用户请求进入系统,到网络传输、资源调度、模型加载、内存管理,再到最终完成推理返回结果,任何一个环节出瓶颈,GPU 就只能停下来。
AI Infra 的四层架构,决定了 GPU 的利用率高低:
第一层是能源基础设施,决定 GPU 能不能稳定运行;
第二层是计算硬件,包括 GPU、高带宽内存、高速互联等,决定理论算力上限;
第三层是系统软件,比如 Cuda 编译器、通信库、算子库,决定能不能把算力用到物理极限;

第四层是服务编排,负责协调 GPU 资源、调度任务,推理引擎、请求调度都属于这一层。
这四层里,电力、散热、硬件改造都是硬问题,优化空间已经见顶;而系统软件和服务编排是软问题,投入后能带来数倍性能提升。现在行业的注意力,已经快速转向这两个软层面。
AI Infra 四层架构中,系统软件和服务编排的优化,能带来 2-4 倍的性能提升。比如把利用率从 50% 推到 90% 以上,相当于凭空多出一台机柜,直接把浪费的成本赚回来。

那具体要怎么优化?目前所有工作都围绕四个核心问题:哪些计算不用重复做?哪些等待可以消除?哪些算力没吃满?哪些资源没协同?
第一个问题,重复计算的浪费,也就是业界说的 “推理税”。同一段文字反复喂给模型,每次都要从头算,比如智能体工作流里,同样的工具描述可能被调用几十次,每次从零开始,全是白花的钱。
解决这个问题的核心是 KV 缓存复用:把算过的内容存下来,下次直接用,不用从头算。Transformer 解码时,会把历史 token 映射成 key-value 张量,也就是键值缓存。第一次请求预填充时,把每个 token 的 KV 存下来,后续生成新 token 时,只算新的 KV 并追加,历史 KV 直接复用。
但 KV 缓存有个弊端,会占用 GPU 显存,上下文越长、请求越多,显存占用越多,甚至成为推理瓶颈。SGLane 的解决方案是 Radix Attention,用基数树组织海量请求的 KV 缓存,共享同样开头的请求共用一段缓存,只有内容分叉时才各自分支,大幅减少显存占用。

光有好的缓存结构还不够,还要调度器把相似请求安排在一起处理,也就是 cache aware scheduling。就像餐厅后厨连续做三份麻辣香锅,调料和准备工作可以复用,效率更高。SGLane 还做了淘汰机制,显存不够时淘汰最不可能再用的缓存,就像管理手机内存,保留常用的对话前缀和高频文档。
还有分布式缓存感知负载均衡器,把请求发到已有对应缓存的 GPU 上,避免重复计算。
第二个问题,等待的浪费。现在内存价格一季度涨 90%,高端显存缺货到 2027 年,但抢到的卡一半时间都在干等。
最早的推理引擎是排队制,一个算完再算下一个;后来用批处理,凑够一批一起算,但要等所有请求到齐,短请求还要等长请求,用户体验差。现在主流的连续批处理,像随时上下客的公交车,新请求随时上车,算完就下车,GPU 始终满载,能让吞吐量提升 2-4 倍。

还有计算阶段的等待,大模型推理分读入和生成两个阶段,读入阶段算力要求高,生成阶段对显存带宽敏感,过去混在同一张 GPU 里,互相拖累。现在的 prefill-decode 分离,把两个阶段拆到不同 GPU,各自用适配的硬件,通过高速网络传中间结果,Deepseek 和英伟达最新的 Dynamo 架构都在用这个方案,SGLane 也是最早支持大规模部署的引擎之一。
第三个问题,算力跑不满的问题。英伟达 H100 算力比 A100 提升数倍,但推理性能没同步涨,因为 GPU 大量时间花在数据搬运上,受限于串行解码。
目前有两个主要解决方向:一是低精度计算,把模型权重、中间激活值、KV 缓存用更小的数据格式存储或运算,减少显存占用,释放一倍算力空间;二是投机采样,用小模型先猜几个字,再让大模型一次性验证,猜对了一次生成多个字,最佳情况下能把生成速度提升 2-3 倍。

KV 缓存复用、连续批处理、PD 分离是当前三大核心优化方向。推理引擎的作用,就是把这些新技术第一时间集成,打通软件硬件四层,让优化协同起来。比如 Kernel 优化、调度优化、Cuda Graph、连续批处理等技术结合,把推理性能拉满。
SGLane 已经和芯片厂商深度绑定联合优化,英伟达、AMD、联发科等硬件玩家都投资了其孵化的 Radisys ARC,英特尔 CEO 陈立武、Broadcom CEO 陈福阳、OpenAI 联合创始人 John Schulman 等都参与了融资。对他们来说,投资推理引擎是战略下注,需要连接算力与应用的基础设施入口。

除了推理优化,强化学习的兴起也带来了新的挑战。传统训练是单一流程,GPU 干同一种活,而强化学习需要交替进行推理、评估、参数更新,三种计算对硬件需求天差地别,传统框架会导致大量算力浪费。
Radisys ARC 推出的训练框架 Miles,把训练和推理放在同一个系统里考虑,让 SGLane 的推理端产出新样本,Miles 的训练端更新模型权重,形成高效的后训练闭环,减少等待和切换的浪费。目前 Miles 已经被不少前沿实验室采用。
VLLM 和 SGLane 原本是开源社区项目,靠研究者和工程师业余维护,但随着算力需求爆发,仅靠开源社区已经无法满足庞大需求,主创团队纷纷创业商业化。

和云计算改变服务器行业一样,未来 AI Infra 也可能成为整个 AI 行业共享的基础设施。现在开源模型迭代速度越来越快,但开放的只是权重,开发者依然要解决部署、显存、吞吐和调度等问题。推理引擎就像 AI 时代的操作系统,成为连接模型与芯片的关键一层。
Radisys ARC 的目标,就是让更多有想法的团队不用被 AI Infra 的门槛拖慢脚步,降低 AI 创业的难度,让更多人能做出自己的 AI 产品。当 AI Infra 的能力变成公共品,AGI 的距离就会更近一步。
更新时间:2026-08-03
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号