MoE大模型推理只靠堆GPU?这条Token 超级通道来了

原创2026-09-15 14:12:17浏览2021
2021
Star

很多人以为,只要堆起 GPU 就等于拥有强大 AI 能力。但事实是:算力不等于实际产出。原因是,Token是大模型处理和输出内容的基础单元,其生成效率直接影响模型的响应速度和服务能力。从模型训练时的梯度同步,到推理阶段KV Cache跨节点迁移,海量数据需要在多块GPU之间分发汇总,一旦出现CPU调度拖累、存储访问卡顿、网络链路抖动,就会造成GPU空转等待,直接拉低集群算力利用率,推高AI业务运行成本。

 

以推理阶段KV Cache为例,在 PD(Prefill预填充- Decode解码)分离场景下,Prefill完成后需要把大量 KV Cache 传递给Decode 节点。上下文越长,KV Cache 的数据量越大,网络传输在 TTFT(首Token时延) 中的占比也就越高。

 

如何打通计算、存储、数据传输之间的瓶颈,把硬件算力真正变成大模型稳定输出内容的能力,是当下 AI 行业亟待突破的难题。中科曙光基于 scaleFabric 打造的 Token 加速技术体系,正是针对这一痛点推出的全链路解决方案。

 

中科曙光高速网络互联产品部总工程师万伟表示,scaleFabric通过构建“算存传”三级紧耦合的Token加速通道,在网络层面和计算、存储紧密协同,加速token吞吐效率,实现 Token在大模型训练、推理到存储复用全链路的高速流转。

 

 

算:绕过CPU,支持GPU直通网络的IBGDA技术实现在国内首次规模化落地

 

 

推理时代,MoE已成为模型主流架构,IBGDA技术的价值进一步凸显。MoE 模型单次推理仅激活少量专家,计算开销低于同能力稠密模型;但模型包含全部专家权重,整体显存需求大,通常需要多 GPU 做专家并行存储。代价是 Token 路由、跨卡数据分发与 Decode 阶段 KV Cache 迁移带来大量通信开销。GPU数量越多,跨节点数据流转压力越大,极易造成 GPU 等待,制约 Token 吞吐,这也是 MoE 推理规模化落地的核心卡点。

 

在模型通信中,Token分发与合并会产生大量并发小消息,由CPU作为“中介”参与转发调度会带来显著的延迟与CPU开销。IBGDA则通过减少CPU参与关键通信路径,大幅提升了MoE专家并行通信效率。

 

在计算环节,GDR允许网卡直接读写GPU显存,绕过CPU内存中转;而IBGDA技术则进一步将通信控制交给GPU,使GPU能够直接驱动网卡并管理数据传输,彻底消除传统路径CPU在协调通信时产生的延迟和瓶颈,让 GPU 集群间的通信(尤其是高频、小包的场景)变得更加高效和可扩展,让计算与通信衔接得更加紧密。

 

此前,IBGDA的规模化落地始终由国际厂商主导,国产RDMA网卡与GPU直通的落地案例极为罕见。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。

 

目前,scaleFabric已经完成与DeepEP等通信框架的适配,进一步完善了scaleFabric面向大模型的软件生态,推动IBGDA融入现有应用环境,加快相关技术走向业务应用。

 

曙光信息产业(北京)有限公司 scaleFabric 产品经理纵瑞博谈到,在 AI 生态方面,我们采用开放架构。后续,我们希望让 scaleFabric 网络与更多国产厂商的产品完成适配和优化。在 RoCE 和 NVIDIA InfiniBand 之外,为产业提供全国产、高性价比的网络方案,为各类 GPU、CPU 及其他硬件厂商提供技术支撑。

 

存:三项技术构建存储直通体系

 

在存储环节,scaleFabric围绕Token的存储访问瓶颈,构建了完整的存储直通技术体系。NVMe over RDMA、XDS和NFS over RDMA三项技术,分别用于加快远端NVMe存储访问、支持GPU直接访问远端存储,以及提升传统文件存储的传输效率,共同打造存储与算力之间的高速网络通道。大幅缩短TTFT(首Token时延),提升推理时的token吞吐能力,减少单token的生成成本。

 

NVMe over RDMA:


利用scaleFabric的低时延、无损RDMA网络,让计算节点能够高速访问远端NVMe存储如同访问本地硬盘,存储访问延迟降低80%以上。在KV Cache卸载、分布式训练数据读取、推理数据访问等场景中,NVMe over RDMA使存储不再成为Token生成的瓶颈,大幅缩短TTFT(首Token时延)。

 

NFS over RDMA:
面向文件存储协议场景,将NFS文件存储体系运行在scaleFabric的RDMA高速网络之上,让依赖文件存储的AI训练任务无需改变应用习惯即可获得RDMA加速。

 

其核心原理是:RDMA网卡(RNIC)直接将数据从存储节点的内存传输到计算节点的内存,全程无需CPU介入、无需内核参与、无需多次拷贝,实现了真正的“零拷贝”数据高速公路。

NFS over RDMA的价值在AI训练场景中尤为突出。AI训练任务需要频繁从共享存储中加载海量训练数据,传统的NFS over TCP/IP往往成为I/O瓶颈。

 

采用NFS over RDMA后,数据从存储到GPU内存的路径被彻底重构,有实践表明可将GPU利用率从约55%提升至95%以上,单轮训练时间减少30%至60%。此外,还能通过内核旁路降低延迟、提高大容量数据传输的吞吐量,并显著降低客户端和服务器的CPU使用率。scaleFabric目前也已支持NFS over RDMA,对于依赖文件存储的系统而言,NFS over scaleFabric是在不改变现有应用和运维习惯的前提下,大幅提升存储性能的最优选项。

 

xDS(XPU Direct Storage) :


通过scaleFabric提供的高速RDMA数据通道,允许XPU(包括GPU、DCU等加速处理器)绕过CPU和系统内存,通过RDMA网络直接访问远端存储设备。数据从存储节点经RDMA网卡直接写入XPU显存,全程零拷贝、无需CPU介入,大幅缩短存储访问延迟、XPU数据等待时间——这意味着GPU不再因等待训练数据而空转,集群有效算力利用率大幅提升。

 

 

传:低时延多级网络交换,将IBGDA和存储直通优势带到大规模集群

 

Token从诞生到交付,在智算集群中需经过多级网络交换。以典型的两层CLOS架构为例,一个Token从源GPU发出,依次经历接入交换机(Leaf)→ 汇聚交换机(Spine)→ 目标接入交换机(Leaf) ,完成三跳转发。每一次跳转都意味着时延的累加——在万卡级分布式训练中,网络通信耗时已占整体任务时间的30%至50%。scaleFabric通过极致的单跳性能与端到端优化,让Token在多跳路径中“每一跳都快、全程不减速”。

 

1)极致单跳性能

scaleFabric转发时延低至260ns,端到端时延<1μs,与英伟达NDR持平,优于主流RoCE方案,在性能上已经达到国际一流水平。

 

2)多跳不减速

实测数据显示,在一跳与三跳路径下,scaleFabric 均保持更平缓的大消息时延增长曲线。以4k以上的大消息包文为例,scaleFabric三跳时延约11μs,较RoCE方案低约 63% 。这一能力面向 PD 分离的 KV Cache 搬运与 MoE All-to-All 大规模通信,可为 Token 生成提供更稳定的跨节点传输基础。

 

较低的三跳时延可以减少数据在多级网络中的传输耗时,使IBGDA和存储直通带来的路径优化进一步延伸至大规模集群,推动计算、存储和网络共同作用于Token生成效率。

 

万伟表示,随着集群规模继续扩大,一方面,我们会保持现有的免维护网络管理优势,以及链路故障后的路由快速恢复能力。这些都是大规模组网中的重要优势。另一方面,下一代产品会支持更多优化的拥塞控制算法,提供更好的用户可配置能力,让用户拥有更多调整手段。下一代技术还会支持多平面、包喷洒和乱序重组等能力。