芯信光:AI算力“光进电退”浪潮中的创业机会识别与战略抉择

企业 武汉芯信光科技有限责任公司
行业 信息传输、软件和信息技术服务业
年份 2026
难度 高级
适用课程 创业管理
核心概念 机会识别, 资源编排, 创业拼凑, 制度合法性
来源 改编

案例摘要

一、案例背景 1.1 行业变局:当AI算力撞上“功耗墙” 2026年,全球AI算力基础设施正经历一场深刻的结构性变革。随着大模型参数规模从千亿级向万亿级跃迁,单个AI训练集群的GPU数量已从早期的千卡级迈向十万卡量级。以英伟达GB200 NVL72为代表的机架级算力单元,单机架功耗已突破120千瓦,而一个十万卡集群的整体功耗则达到惊人的百兆瓦级别。在这场算力军备竞赛中,一个曾被忽视的瓶颈正在…

案例正文

一、案例背景

1.1 行业变局:当AI算力撞上“功耗墙”

2026年,全球AI算力基础设施正经历一场深刻的结构性变革。随着大模型参数规模从千亿级向万亿级跃迁,单个AI训练集群的GPU数量已从早期的千卡级迈向十万卡量级。以英伟达GB200 NVL72为代表的机架级算力单元,单机架功耗已突破120千瓦,而一个十万卡集群的整体功耗则达到惊人的百兆瓦级别。在这场算力军备竞赛中,一个曾被忽视的瓶颈正在浮出水面:GPU之间的数据交换网络。

传统数据中心内部互联依赖电交换机构建的层次化网络架构(如叶脊架构),信号在GPU之间传输时需要经历“光—电—光”的多次转换:GPU发出的光信号在交换机端口被转换为电信号进行路由和交换,再转换为光信号发往下游。这一过程在低带宽时代尚可接受,但当单端口速率从100G向800G甚至1.6T演进时,电交换芯片的功耗和散热问题呈指数级恶化。根据行业测算,在十万卡集群中,网络交换设备的功耗可占集群总功耗的15%—20%,其中相当比例消耗在光电转换环节。

更为关键的是,电交换机的带宽扩展正逼近物理极限。商用交换芯片的容量虽然仍在增长,但每比特功耗的下降速度已明显放缓,而AI集群对互联带宽的需求却以每年2—3倍的速度膨胀。这一“剪刀差”使得“以光代电”从实验室概念走向产业化前沿。

1.2 技术解方:光电路交换(OCS)的产业化契机

光电路交换(Optical Circuit Switch,OCS)技术的核心思路是:在光域直接完成信号路径切换,避免光电转换带来的功耗和延迟开销。其典型实现方式包括基于MEMS微镜阵列的三维光交换、基于液晶(LCoS)的光束偏转,以及基于硅光集成的波长选择开关等。其中,谷歌在其TPU集群中率先大规模部署了基于MEMS的OCS系统,验证了该技术在超大规模AI训练场景下的可行性和经济性。

OCS的价值主张清晰而有力:首先,在功耗方面,光路切换本身不涉及光电转换,单端口功耗可降低一个数量级以上;其次,在延迟方面,光信号以光速传输,无需排队和缓冲,端到端延迟大幅降低;再次,在扩展性方面,光交换矩阵的端口数可远超电交换芯片,且升级带宽只需更换光模块而非整机。这些优势使得OCS被业界视为破解AI算力集群互联瓶颈的关键路径之一。

……

发表讨论

您的邮箱地址不会被公开。