AI时代的“网络卡脖子”:数据中心基础设施的算力悖论

企业 是德科技、中科曙光、Broadcom等
行业 信息传输、软件和信息技术服务业
年份 2026
难度 高级
适用课程 数字经济与平台经济
核心概念 网络外部性,数字基础设施,算力-网络协同,平台生态
来源 改编

案例摘要

一、案例背景 (一)AI算力竞赛的范式转移 2026年,全球人工智能产业的竞争格局正在经历一场深刻的底层逻辑重构。过去数年,业界习惯于以单颗GPU的算力指标——如每秒浮点运算次数(FLOPS)——来衡量AI基础设施的先进程度。英伟达等芯片巨头每年推出的新一代GPU产品,其算力性能的跃升往往被视为AI产业进步的标志性事件。然而,当大模型训练集群从千卡规模迈向万卡乃至十万卡规模时,一个此前被忽视…

案例正文

一、案例背景

(一)AI算力竞赛的范式转移

2026年,全球人工智能产业的竞争格局正在经历一场深刻的底层逻辑重构。过去数年,业界习惯于以单颗GPU的算力指标——如每秒浮点运算次数(FLOPS)——来衡量AI基础设施的先进程度。英伟达等芯片巨头每年推出的新一代GPU产品,其算力性能的跃升往往被视为AI产业进步的标志性事件。然而,当大模型训练集群从千卡规模迈向万卡乃至十万卡规模时,一个此前被忽视的瓶颈开始浮出水面:网络。

这并非一个全新的问题。早在2023年前后,业界就已经开始关注到AI集群中“GPU空转”的现象。但到了2026年,这一问题已经严重到足以改写算力竞赛规则的程度。正如一条高速公路,即便车道修得再宽,如果收费站拥堵,车辆依然无法快速通行。AI集群正在遭遇的,正是这样一场系统性的“交通瘫痪”。

(二)数据的“拥堵时代”

是德科技(Keysight Technologies)网络与数据中心副总裁Joachim Peerlings在Keysight World大会上展示的一组数据,揭示了问题的严峻性:在计算机视觉模型训练中,GPU有超过60%的时间花费在数据移动和通信上,真正用于计算的时间仅占20%左右。这意味着,一块价值数万美元的GPU,其大部分生命周期不是在“计算”,而是在“等待”——等待数据从相邻的GPU传输过来。

更令人忧虑的是训练失败率。在资源最密集的大语言模型训练任务中,因网络问题导致的训练失败率高达21%。换言之,每五次训练就有一次因网络故障而中断,而一次中断可能意味着数小时甚至数天的计算成果付诸东流。对于动辄投入数千万美元训练成本的大模型项目而言,这一比例带来的经济损失是天文数字。

中科曙光高级副总裁李斌的估算进一步说明了问题的规模:传统CPU计算节点,一台机器配一张网卡即可满足需求;但如今以GPU为中心的计算节点,一台机器需要配置八张甚至更多网卡。“相比原来的数据中心高速网络用量,基本提升了10到20倍。”这种网络需求的指数级增长,使得数据中心的基础设施架构面临根本性的重构压力。

……

发表讨论

您的邮箱地址不会被公开。