当前位置:首页 > 网球资讯 > 正文内容

“榨”出硅的极限:怎么让GPU不“闲着”?

杏彩体育3周前 (08-04)网球资讯47


2026年的AI行业,正在上演一场看似矛盾、实则贯穿产业底层的博弈:全行业疯狂抢卡、重金建算力中心,高端GPU一卡难求、显存缺货持续至2027年;但海量已部署的GPU、数据中心算力,却长期处于空转浪费状态,算力错配、效率低下成为全行业通病。

当硬件堆料的边际效应快速递减,单纯靠采购GPU、扩建机房的增长模式逐渐走到瓶颈,一场无声的“算力效率革命”悄然开启。行业竞争的核心,从谁的GPU更多,转向了谁的GPU用得更满。

这场革命的核心赛道,正是AI Infra(人工智能基础设施层)。它不生产新算力,却能通过软件与系统优化,盘活闲置算力、榨干硅片极限,催生出全新的千亿级产业蓝海。125.jpg

一、巨头造芯白热化:硬件内卷之外,软件优化成必答题

当下AI行业的顶层竞争,首先体现在极致的硬件自研竞赛中,各大科技巨头纷纷下场造芯,试图从底层掌控算力话语权。

7月20日,The Information爆料,谷歌正在秘密研发内部代号“Frozen v2”的服务器芯片,核心思路颠覆传统设计——直接将Gemini大模型的部分核心架构固化进硅片,通过软硬件深度绑定,极致压缩推理延迟、提升算力匹配度。

往前回溯一个月,6月24日OpenAI亮出与博通联合研发的首款推理芯片Jalapeño,从立项设计到最终流片仅用时九个月,以极致效率落地专属AI推理硬件,补齐自身算力硬件短板。

不止谷歌、OpenAI,Anthropic、智谱、DeepSeek等国内外头部大模型厂商,均已相继布局自研芯片或定制化算力硬件,扎堆入局“造芯大战”。

但自研芯片是顶级巨头的专属游戏,重资金、长周期、高门槛,绝大多数中小AI企业、模型团队根本无力跟进。对全行业绝大多数参与者而言,无法再造新卡,就只能盘活旧卡。

这一产业缺口,让AI Infra赛道迎来爆发式增长,成为资本与巨头共同押注的新风口。一众赛道明星企业估值暴涨、营收飞升:AI推理平台Baseten一年内营收增长20倍,估值从21亿美元飙升至130亿美元;同赛道的Fireworks,七个月内估值翻四倍至175亿美元,年化营收突破10亿美元。

更具标志性的是,两大开源推理引擎标杆vLLM、SGLang先后官宣商业化,首轮种子轮融资均突破1亿美元,集结了全球AI巨头与顶级风投,正式开启AI Infra赛道的强强对决。

至此,GPU利用率取代GPU数量,成为硅谷最新核心关键词,AI行业正式迈入“算力效率为王”的新阶段。

二、行业核心矛盾:疯狂缺卡的背后,是大规模GPU空转浪费

AI行业的重心,早已从重投入、长周期的模型训练,全面转向高频、持续、海量的模型推理。训练是一次性重资产投入,完成参数迭代后即可落幕;而推理是永续性需求,Chatbot、AI Agent、各类智能应用的普及,让GPU需要不间断处理海量用户请求,推理需求呈爆发式增长。

正如RadixArk联合创始人朱邦华所言:“随着新的应用逐渐增多,推理的总量会比原来大很多。随着大家不断拓展应用、不断拓展模型的智能边界,推理的需求会越来越大。现在已经大到,市面上的卡基本都很难找到,每一家都缺卡。”

面对极致的算力缺口,巨头的第一解法永远是砸钱扩产。Meta、谷歌、微软等科技巨头持续加码资本开支,2026年合计算力投入预计突破1万亿美元;黄仁勋更是预判,2030年全球AI基础设施年投资规模将达到4万亿美元。

但华尔街始终保持理性担忧,前微软能源战略经理、突破能源科研总监Ethan Xu点明了核心风险:“华尔街的担心不无道理,过去我们是有前车之鉴的。像互联网时代泡沫的破灭,当时大量资金投入到光纤建设、互联网公司,虽然长期来看实现了它们的价值,但短期出现了很大的问题。”

海量资本无脑堆硬件,极易造成新一轮算力泡沫。行业真正的破局之道,从来不是无限扩产,而是解决最核心的问题——GPU大面积闲置、算力严重浪费。

行业长期存在一个致命误区:多数人以为GPU时刻处于满负荷运转,实则绝大多数时间里,高端GPU都在空转等待、无效耗能。

GPU只是AI系统的一环,一条用户请求的完整链路,需要历经网络传输、资源调度、模型加载、内存管理、推理计算、结果返回全流程。整条链路中,只要任意一个环节出现瓶颈,GPU就只能暂停计算、被动等待,昂贵算力就此闲置浪费。

卡内基梅隆大学(CMU)今年4月发布的权威研究,彻底撕开了行业痛点。团队对大型学术AI集群中756块主流GPU,开展了长达31天的细粒度全时段遥测,覆盖A6000、L40S、A100、H100、B200等全系列主流型号。

监测数据触目惊心:GPU普遍存在严重的“execution-idle(执行时空转)”问题,集群整体近20%的执行时间、11%的能耗全部浪费在无效等待上。细分场景差距更为夸张,Azure代码推理负载65%的能耗归于空转,OpenAI对话类推理请求的空转能耗占比也高达52%。

一边是一卡难求、算力紧缺,一边是半数算力白白浪费,这组极致矛盾,正是AI Infra赛道崛起的核心底层逻辑。

三、AI Infra四层架构:找准算力浪费的核心症结

想要彻底解决GPU闲置问题,首先需要厘清AI Infra的完整四层架构。四层层级层层递进,共同决定GPU的最终利用率,也是算力优化的全部抓手。

1. 能源基础设施层:底层稳定基石

核心是电力与散热体系,决定GPU能否持续、稳定、满负荷运行。电力不足、散热过载,会直接导致GPU降频、卡顿、停机,是算力释放的基础前提。该层级属于硬基建,改造周期以年为单位,优化空间有限且逐步见顶。

2. 计算硬件基础设施层:物理算力上限

包含GPU、高带宽存储(HBM)、NVLink、InfiniBand高速互联网络、配套CPU等全部硬件设备,决定系统理论算力峰值。当下高端硬件迭代速度放缓,硬件互联、存储带宽的优化空间快速收窄,单纯硬件升级性价比持续走低。

3. 系统软件层:硬件能力转换器

涵盖CUDA、编译器、通信库、内存管理、底层算子(Kernel)库等核心软件体系,核心作用是将硬件的理论算力,转化为实际可用的有效算力。软件优化不足,再顶级的硬件也无法发挥极致性能,是算力浪费的重要隐形原因。

4. 服务编排层:算力调度核心中枢

负责全局GPU资源协调、任务优先级划分、多业务动态调度,涵盖推理引擎、训练框架、请求调度、资源管理等核心模块,vLLM、SGLang等行业标杆项目均诞生于此。这是近年技术创新最密集、优化空间最大、性价比最高的赛道,也是盘活闲置GPU的核心关键。

四层架构对应两类截然不同的问题:能源、硬件属于“硬瓶颈”,投入大、周期长、上限低;系统软件、服务编排属于“软瓶颈”,依托工程优化与算法迭代,即可实现数倍性能提升、大幅降低算力成本,是当下行业最优解。

正如RadixArk技术成员陈震林所言:“尽管成本主要发生在物理层,但大部分工作都要放在软件层和服务编排。因为你把人力投入到这一块当中,能够带来最大的优化可能性。”

硬件优化的边际成本极高,软件优化的红利却无上限。一台售价400万美元的NVIDIA GB200 NVL72机柜,若软件调度优化不足,GPU利用率仅50%,相当于200万美元的硬件资产白白损耗;若通过AI Infra优化将利用率提升至90%以上,无需新增任何硬件,等同于凭空多出半台机柜的算力。

这也是为什么Anthropic、OpenAI、谷歌等顶级模型公司,纷纷重兵布局AI Infra的核心原因。目前Anthropic推理优化团队已超200人,正是这套软件优化体系,让其从算力不稳定、成本高昂,实现极致降本增效,助力公司二季度顺利盈利。

四、四大核心优化逻辑:从根源榨干硅片极限

当下行业所有AI Infra优化技术,均可归结为四大核心命题:哪些计算无需重算?哪些等待可以消除?哪些算力尚未吃满?哪些资源未能协同?

vLLM、SGLang两大主流开源框架,均围绕这四大命题迭代升级,只是技术路径各有侧重:vLLM凭借PagedAttention技术立足,主打通用场景的高效推理部署;SGLang聚焦执行流程重构,侧重计算复用与系统性优化。两者相辅相成,构成当下AI算力优化的技术底座。

1. 消除重复计算:KV Cache极致复用,砍掉无效“推理税”

大模型推理长期存在一个极具浪费的行业痛点:相同提示词、相同工具指令、相同对话前缀,每次触发请求都需要从头计算,重复算力消耗被业内戏称为“推理税”,在AI Agent工作流中尤为突出,相同指令单日可重复调用数十次,算力浪费极其严重。

破解这一问题的核心技术,是KV Cache复用,也是当下降本增效最直接、效果最显著的方案。Anthropic曾通过该技术完成极致优化,直接将推理成本削减90%,实现十倍级效率提升。

其核心原理简单清晰:大模型解码过程中,自注意力机制会将历史Token映射为Key/Value张量,KV Cache会在首次预填充(Prefill)阶段,缓存所有Prompt对应的KV数据。后续解码生成新Token时,仅需计算新增内容,历史数据直接复用,无需重复计算,大幅降低延迟、节省算力。

但传统KV Cache存在致命短板:海量缓存数据会大量占用珍贵显存,上下文越长、并发请求越多,显存压力越大,极易触发显存瓶颈,限制推理并发与响应速度。

SGLang创新性引入基数树(Radix Tree)数据结构,彻底重构缓存逻辑,完美适配AI Agent时代的业务特征。简单来说,就是将所有请求的缓存数据构建成一棵共享前缀树,相同系统提示词、相似用户问句共用同一缓存枝干,仅差异化内容单独迭代,最大化实现缓存复用。

朱邦华对此解读:“现在的智能体世界里,很多时候会有很多共享的系统提示词,在共享的系统提示词之后会有不同的用户提示词,而在同一个用户提示词下面,大家会接着问问题,所以树状结构就会不断向下延伸。这也是SGLang论文比较有远见的地方,它在2023年的时候就已经大概预见到了这样的模式。随着智能体编程的用户越来越多,Radix Tree,也包括SGLang本身的prefix cache(前缀缓存)这套系统,带来的增益就越来越大。”

在此基础上,行业形成一套完整的缓存优化体系:

缓存感知调度(Cache-aware scheduling):将前缀相似的请求批量集中处理,如同餐厅集中制作同款菜品,减少频繁切换、重复准备的损耗,大幅提升缓存命中率与处理效率。

智能淘汰机制(Eviction):模拟手机内存管理逻辑,优先保留高频复用的系统提示词、RAG文档、近期对话前缀,淘汰长期闲置、复用价值极低的缓存,在显存有限的前提下最大化缓存收益。

分布式缓存负载均衡:跨GPU、跨节点精准调度,将相似请求定向分发至已有对应缓存的GPU,避免缓存跨节点失效、重复计算,实现全局算力最优匹配。

2. 消除无效等待:重构调度逻辑,让GPU时刻满载

GPU空转的第二大核心原因,是各类无效等待,包括请求排队等待、长短任务互相拖累、前后计算阶段互相阻塞等,传统调度模式的低效问题被无限放大。

行业调度模式历经三次迭代,彻底终结无效等待问题。最早的排队制“一单一清”,GPU大量时间闲置;中期的批量处理需要凑齐任务再执行,依然存在等待损耗,且长短任务混跑会出现“短任务等长任务”的体验与算力双重损耗。

当下主流的连续批处理(Continuous Batching)模式,彻底颠覆传统逻辑。如同随时上下客的公交车,新请求可随时接入,完成的请求可即时退出,无需凑批、无需等待,让GPU始终保持满载运行,直接将GPU吞吐量提升2-4倍。

除了请求等待,推理内部的阶段阻塞同样致命。大模型推理分为两大核心阶段:Prefill(预填充)阶段算力密集、侧重计算速度,Decode(逐字生成)阶段带宽密集、侧重显存读写。传统模式将两个阶段混跑在同一GPU上,互相拖累、互相等待,算力与带宽资源双双浪费。

行业主流方案升级为Prefill/Decode分离部署,将两个阶段拆分至不同GPU集群独立运行,匹配专属硬件配置,通过高速网络传输中间结果。DeepSeek已率先落地该方案,32张GPU组成专属Prefill计算单元负责快速读题,另一批GPU承接Decode逐字生成任务,两套集群各司其职、互不干扰,彻底消除阶段等待损耗。

3. 释放潜在算力:突破硬件瓶颈,压榨硅片极限

英伟达H100、B200等新一代GPU面世后,理论算力大幅跃升,但实际推理性能并未同步提升。核心原因在于,大量算力被数据搬运、串行解码拖累,硬件峰值算力无法有效释放。行业主要通过两大技术路径,突破硬件算力上限。

一是独立精度量化优化。模型运行时,显存主要承载模型权重、中间激活值、KV Cache三类数据,三类数据可独立配置精度。通过降低非核心数据的存储与运算精度,既能大幅减少显存占用、缓解内存墙压力,又能充分调用GPU低精度高速算力,最优场景下可直接释放一倍以上的可用算力。

二是投机采样(Speculative Decoding)。通过“大小模型协同”模式提速,轻量化草稿模型提前预判生成后续文本,主模型一次性批量校验。类比为助教提前草拟内容、老师批量审核,替代逐字校验的低效模式,最佳场景下可将文本生成速度提升2-3倍,推理引擎则负责打通软硬件协同,落地极致提速效果。

4. 全域资源协同:适配强化学习新范式

随着OpenAI o1、DeepSeek R1等新一代模型普及,强化学习(RL)后训练成为模型迭代核心方式,也对算力调度提出了全新要求。

传统模型训练模式单一,仅需重复“喂数据-更新参数”,算力调度逻辑简单。但强化学习是推理、评估、参数更新三者循环交替的复合流程,三类任务对硬件算力、显存、带宽的需求完全不同,传统框架混跑模式会造成严重的资源争抢与算力闲置。

RadixArk推出的Miles框架,针对性解决这一行业痛点,核心突破是将训练与推理纳入同一调度系统,实现全域资源协同。在强化学习交替迭代的流程中,精准分配算力资源,避免推理、训练互相等待、互相挤占,彻底解决复合任务下的算力浪费问题,同时适配模型迭代与推理部署的双重需求。

五、产业终局:AI Infra从巨头壁垒,变成行业公共基建

长期以来,顶级AI Infra能力是头部巨头的独家壁垒。OpenAI、Anthropic、谷歌凭借雄厚资金与技术团队,自研专属调度、缓存、优化体系,实现算力极致降本增效,构建中小团队无法逾越的优势。

但vLLM、SGLang等开源项目的崛起,彻底打破了技术垄断。早期依靠社区开发者为爱发电、迭代更新,如今随着算力缺口持续扩大、行业优化需求爆发,开源模式已无法满足工业化、规模化的落地需求。两大项目主创团队先后独立创业、开启商业化,以专业团队持续迭代技术,服务全行业。

与此同时,黄仁勋牵头成立开源AI联盟,聚合芯片厂商、模型企业、AI Infra服务商,打通软硬件适配壁垒,推动算力优化技术标准化、普惠化。

这意味着,AI Infra正在从少数巨头的私有技术壁垒,转变为全行业可复用的公共基础设施。

未来的AI行业竞争,不再单纯比拼硬件储备、资金体量。中小团队无需重金堆砌算力、无需组建百人优化团队,即可依托成熟的AI Infra工具,盘活现有GPU资源、榨干硅片性能,大幅降低AI创业与技术创新门槛。

算力泡沫的消解、硬件价值的最大化、创新门槛的降低,所有变化的核心指向同一个终点:让每一块昂贵的GPU都不再闲置,让每一分算力投入都能兑现价值,让AGI的落地进程,不再被低效的算力调度拖慢脚步。


扫描二维码推送至手机访问。

版权声明:本文由杏彩体育-专注全球体育资讯发布,如需转载请注明出处。

本文链接:http://www.redirected.net/?id=15950

分享给朋友:

““榨”出硅的极限:怎么让GPU不“闲着”?” 的相关文章

中国网球1喜1忧!星二代6连胜剑指第2冠,张帅1轮游单打5连败!

中国网球1喜1忧!星二代6连胜剑指第2冠,张帅1轮游单打5连败!

今晨,WTA和ITF两站赛事同时打响首轮争夺,中国网球1喜1忧。本周刚刚取得世界排名的商竣程在成年赛第2站拿到开门红,豪取6连胜剑指生涯第2冠;金花一姐张帅则在印第安维尔斯站女单首轮铩羽而归,打满3盘不敌乌克兰00后科斯秋克,上演1轮游并吞下单打5连败。...

经典动漫《网球王子》

经典动漫《网球王子》

作为一个80后的老阿姨,我最喜欢看的日本动漫就是《网球王子》,到目前为止至少看了不少于三遍,每次看都觉得自己也年轻了不少。 《网球王子》里面的人物每一个都是那么帅气可爱,真的是百看不厌啊。 越前龙马 之前一直在美国生活,并且在美国夺得青少年网球四连霸,被称...

网球肘干货解析,防治与康复同样重要!

网球肘干货解析,防治与康复同样重要!

什么是网球肘 网球肘又称为肱骨外上髁炎,是肌腱炎的一种,可引发肘部和手臂疼痛。这些肌腱是连接下臂肌肉与骨骼的坚韧组织,当肘关节外侧前臂伸肌起点处肌腱发炎疼痛。疼痛的产生是由于前臂背桡侧和手部伸肌群重复用力引起的慢性撕拉伤造成的。虽然名为网球肘,但即便从未打过网球,也有可能...

网球肘是怎么回事?网球肘的原因

网球肘的致病因素很多,但一般认为是因前臂肌肉的长期反复强烈的收缩、牵拉,使这些肌腱的附着处发生不同程度的急性或慢性损伤,肌纤维形成无菌性炎症反应而发病,部分患者还会伴随肘关节小关节错位,压迫关节韧带使关节活动受限,扭毛巾时症状会明显加重,网球肘不仅在运动人群和工人...

天天说的“网球肘”到底是个什么东西?医生告诉你如何处理!

天天说的“网球肘”到底是个什么东西?医生告诉你如何处理!

有研究对529名美国网球协会(United States Tennis Association, USTA)业余运动员的一项调查发现,肘关节是最常受伤的关节,占全部损伤的大约20%。在这项研究中,肘部损伤的患病率为每100名运动员(平均年龄46.9岁)中发生10.6例损伤...

网球肘的症状位置图片,网球肘如何形成的?和这些原因有关

网球肘的症状位置图片,网球肘如何形成的?和这些原因有关

原标题:网球肘的症状位置图片,网球肘如何形成的?和这些原因有关 大家对于网球肘都是只有一个笼统的概念,一般都是表现为相应部位的疼痛。例如肘关节外侧酸痛,人自觉肘关节外上方活动痛,疼痛有时可向上或向下放射,感觉酸胀不适,不愿活动。手不能用力握物,握锹、提壶、拧毛巾、打毛衣等运动可使...