全国产算力助力!中国首个十万卡集群成功落成开启十万卡时代

2026-08-11 -

允中 发自 凹非寺

量子位 | 公众号

中国AI算力,一脚油门踩进了十万卡时代。

7月10日, 在郑州, 中科曙光宣告, 全国产的那个AI超集群曙光8000(登峰)实实在在地正式落成了, 并且是依托国家超算互联网, 又同步接入全面一体化的算力网。

十万张国产加速卡,跑起来了。

这并非是一个被称作“加大号”的万卡集群 , 万卡朝着十万卡转变 , 并非只是简单增添几个零 , 实则是一道具备全然不同特性的工程题。

规模每提升一个级别, 网络为何不会拥堵, 存储究竟为何不会崩溃, 散热到底为何不会烧毁, 调度怎么居然不会混乱呢——那系统复杂度可是以指数级的速度成倍递增的!

更关键的是,这座集群走的不是“堆卡”的老路。

一座Token工厂,两种活都要能干

当下, AI算力中心存在一种较为普遍的尴尬状况, 那就是, 构建了众多的集群情况下, 具备运行大模型能力的却无法运行科学计算程序, 而能够运行科学计算程序的地方, 却没有足够能力训练大模型。

“两头不靠”的结构性错配,让大量算力资源躺在机房里晒太阳。

曙光8000所给出的解法是“原生超智融合”, 它是同一套系统, 这套系统能够扛住FP64双精度的科学计算任务, 并且还能够跑满万亿参数大模型的训练需求。

从FP64到INT8,全精度覆盖。

那并非是将超算与智算拼凑到一块儿, 而是于架构设计的阶段, 就把这两件事情当成一件事情去开展。

打个比方:以前的思路是为卡车修一条路,为轿车修另一条路。

此刻,正在修筑一条道路, 这条道路能够让卡车与轿车同时行驶。看上去通通都是路, 然而其设计逻辑全然不一样。

哪怕“超智融合”概念并非新鲜事物, 可是作为在业内属于首个依据原生超智融合路线构筑、能够支持全精度计算的十万卡级算力集群案例, 曙光8000无疑为国产算力资源配置优化, 给出了一条现实路径。

通过搭建“超智融合”平台, 把分散的超算中心以及智算中心资源进行池化, 从而达成跨平台、跨架构的统一调度, 这对提升国产算力利用率、降低重复建设成本有着极大的领航之义。

工程奇迹不在纸上,在机房里

关于十万卡集群所具有的工程难度, 在业内相关人士心里都清楚明白, 然而中科曙光依旧创造出了历史纪录。

2024年进行系统研制, 2025年完成工程建设, 今年2月3万卡上线试运行, 4月份又一次投用6万卡AI4S集群, 7月份10万卡部署实现落地。

这个称得上奇迹的工程, 令人不禁咂舌, 它源头在于多年经过三十多回沉淀积聚起来的中科曙光工程能力。

为中科曙光高级副总裁李斌所介绍的是, 曙光8000于系统建设方面, 具备芯片能力, 并具备计算能力, 还拥有存储能力, 亦具备网络能力, 同时持有散热能力, 再者拥有管理能力且具备服务能力, 这些均为全链路全国产自研方面之各种能力。

其中,海光等国产芯片为系统建设提供底层支撑;

类IB原生RDMA高速网络实现十万卡集群高可靠连接;

大模型训练以及科学计算其内海量的数据读写, 是由分布式存储予以支撑的, 并且在2026年全球IO500榜单里, 生产型全节点以及10节点性能这两个榜单方面, 收获了双榜第一的成绩。

另外, 加以叠加, 于曙光数创而言, 其在液冷技术方面所具备的核心优势, 能够有效地对MW级高功率密度部署起到支撑作用, 并且借助国产冷媒、全年自然冷却等诸多方式极大地提升曙光8000的能效。

难能可贵的是,如此强大的工程能力不是用来炫技的。

中科曙光已把曙光8000接入国家超算互联网, 且是以算力服务的形式向科研机构以及产业界开放 , 达到了同步的状态。

当下, 完成了三百余项应用适配, 覆盖面在材料、电磁、量子、生物医药、天文气象等二十多个领域, 总共完成了七十余次万卡规模算力测试。

算力的终极命题不是“跑分”,是“用好”

存在一个在 AI 产业中被反复进行验证的规律, 发布会上所展示的参数, 从来都无法在业务现场所面临的考验中跑得过。

曙光8000已经在真实场景中交出了成绩单。

这些并非PPT里的数字, 而是科研团队凭借国产算力所跑出的, 世界级的成果。

更加备受瞩目的是, 曙光8000运用了AI计算开放架构, 其能够支持多品牌AI加速卡, 会兼容主流生态。

这表明, 处于一线的开发者, 以及科研人员, 无需去重新学习一整套封闭的工具链, 那些已有的模型, 还有应用, 能够迅速进行迁移并上线。

有另外一个好处是开放, 它能使整个产业链都得以参与进去, 并非仅仅只能看到一家公司单独进行表演。

在大会举办期间, 中科曙光同北京科学智能研究院达成了战略合作, 并且正式开启了第二套全国产十万卡超智融合算力系统的研制工作, 以及推进这一系统的建设工作。

曙光8000正在从一个示范工程,走向可复制的标准方案。

一条更难的路,一个更大的局

存在着这样一些顶层设计, 它们分别是东数西算, 还有全国一体化算力网, 以及国家超算互联网, 而这些顶层设计所针对的目标, 其实都是同一个事情, 那就是要使得算力能够如同电力一般实现流动起来!

曙光8000落子郑州颇具深意。

郑州具备一定区位特点, 拥有着一定能源条件, 处于特定网络节点地位, 这些综合起来, 使得它在自然状态下就适合去成为连接东西部算力的枢纽。

这一子落下, 这意味着国家算力网的骨干节点, 具备了十万卡级的承载能力。

当更多, 十万卡级节点, 在全国铺开, 中国将率先, 织成全球最大规模的, 算力调度网络。

这才是登峰之后,真正值得看的风景。

*本文系量子位获授权刊载,观点仅为原作者所有。

版权声明

本文仅代表作者观点,不代表本站立场。
本文系作者授权本站发表,未经许可,不得转载。

扫一扫在手机阅读、分享本文