中科曙光发布Token加速技术体系

黄鑫 2026-09-18 12:45:07

Token(词元)效率正成为衡量AI系统实力的新标尺。近日,中科曙光发布Token加速技术体系,以scaleFabric原生无损RDMA为核心网络传输底座,构建算-存-传三级紧耦合的Token加速超级通道。其中,支持GPU直通网络的IBGDA技术实现在国内的首次规模化落地。

中科曙光高速网络互联产品部总工程师万伟表示,现在模型规模越来越大、参数量越来越高,传统的单卡推理越来越难以支撑大模型的参数量需求。在这种情况下,需要采用分布式架构,通过多个节点存放一个模型并完成推理。这意味着模型推理所需的Token相关数据必须在多个节点之间交互。数据流转效率成为影响 Token生成效率的关键因素。

如何打通算存传的数据流转堵点,让硬件算力真正转化为模型的实际输出能力,已经成为亟待解决的现实难题。中科曙光scaleFabric Token加速技术体系,正是瞄准这一行业痛点打造的全链路解决方案。

据介绍,scaleFabric通过构建“算存传”三级紧耦合的Token加速通道,在网络层面和计算、存储紧密协同,加速token吞吐效率,实现 Token在大模型训练、推理到存储复用全链路的高速流转。

推理时代,MoE已成为模型主流架构,IBGDA技术的价值进一步凸显。MoE模型通信中,Token分发与合并会产生大量并发小消息,由CPU作为“中介”参与转发调度会带来显著的延迟与CPU开销。IBGDA则通过减少CPU参与关键通信路径,大幅提升了MoE专家并行通信效率。

此前,IBGDA的规模化落地由国际厂商主导,国产RDMA网卡与GPU直通的落地案例较少。依托scaleFabric原生RDMA无损高速网络,中科曙光自研IBGDA技术已在十万卡级大规模集群中完成验证,实现了这一领域的关键补位。

目前,scaleFabric已经完成与DeepEP等通信框架的适配,进一步完善了scaleFabric面向大模型的软件生态,推动IBGDA融入现有应用环境,加快相关技术走向业务应用。

万伟表示,IBGDA 本身是一种软件优化手段,需要针对不同的国产算力卡逐一适配,让算力卡能够直接访问网络。scaleFabric 网络可以支持不同的异构算力平台。

“制约国产算力发展的一个重要因素,是我们无法采用部分国外高端计算卡。国产算力卡与国外产品在单卡算力上仍有差距。在这种情况下,国内 AI 基础设施的重要发展方向,是通过系统级创新提升整体性能,与国外依靠先进工艺获得的单卡性能竞争。国内算力发展正在依靠集群和多卡互联,通过增加计算卡数量、改善多卡通信效率,满足大模型发展所需的算力要求。采用多卡方式构建集群后,多卡之间的数据通信就成为提升整体计算效率的关键因素。IBGDA 技术在 scaleFabric 中的规模化应用,将成为提升多卡效率的重要支撑。这就是它对行业发展的主要意义。”万伟说。