传输与组网系统

Scale-up

Scale-Up
2026 高频词2026 新词图解

定义

在单个计算域内扩展规模,用高带宽低时延互连把大量加速器连成一台「超级计算机」。
大白话 让几十上百张 GPU 像一颗芯片一样协同干活,通信必须又快又近。这是光互连眼下最值钱的战场。

图解

三个「扩展」的边界 · 决定光互连厂商能吃到哪一段Scale-up · 纵向扩展把大量加速器连成「一台超大计算机」· 对带宽密度与时延最苛刻全连接拓扑NPO / CPO 主战场Scale-out · 横向扩展通过组网增加节点数量 · 主力是 InfiniBand / 以太网 + 可插拔光模块节点间Scale-across · 跨域扩展跨数据中心域扩展 · 靠 DCI 与相干传输,长距光互连的价值落点数据中心 A数据中心 B数据中心 C
三个「扩展」的边界 三个扩展的物理尺度不同,因此对应的技术栈也不同:Scale-up 用 NPO/CPO(最看重带宽密度与时延),Scale-out 用可插拔模块(最看重成本与互通),Scale-across 用相干与 DCI(最看重距离与容量)。写稿时把这三层分开,术语就不会乱用。
超节点:把过去「跨机架组网」的活,收进一个机柜里用光互连完成超节点(Scale-up 域)计算托盘 1GPU + 光引擎计算托盘 2GPU + 光引擎计算托盘 3GPU + 光引擎计算托盘 4GPU + 光引擎计算托盘 5GPU + 光引擎计算托盘 6GPU + 光引擎柜内全连接:光引擎承担托盘间的横向互联,替代过去跨机架的组网为什么用光:柜内距离虽然只有一两米,但全连接拓扑所需的总带宽与纤芯数,铜方案已经撑不住。
超节点内部互联 超节点把原本靠机架间组网完成的横向扩展,收进单个机柜内完成,用光引擎做托盘之间的全连接。距离只有一两米,但带宽密度极高——这正是 NPO/CPO 最核心的落地场景,也是「Scale-up 是当前最值钱的战场」这句话的来源。

说明

Scale-up(纵向扩展)指在单个「域」内把大量加速器连成一台逻辑上的超级计算机,使它们可以像访问本地内存一样高速通信。它对带宽密度与时延的要求是所有场景中最苛刻的。

Scale-up 之所以是当前光互连最值钱的战场,是因为它的瓶颈恰好是铜最不擅长的地方:域内连接数量随加速器数量平方增长,距离虽短但总带宽需求极高。当规模扩大,铜的功耗与信号完整性问题迅速放大,光互连成为必要选项。

技术上,Scale-up 域内的互连主要靠 NPO/CPO 光引擎承担(超节点就是典型实现形态),协议层则涉及 NVLink/NVSwitch、UALink 等专用互连。与 Scale-out 不同,它更看重带宽密度与时延,而不是互通性与成本。

关键数字

域内全连接拓扑特征
带宽密度 / 时延首要考核指标
NPO / CPO主要技术路线

关键要点

  • Scale-up 域内对带宽密度与时延的要求最苛刻,是 NPO/CPO 与光引擎的主要落地场景。
  • 2026 年国内厂商已发布面向 AI 集群 Scale-up 的 6.4T 硅光单模 NPO 光引擎。
  • 与 Scale-out 形成对照:Scale-up 追求域内极致互连,Scale-out 追求规模与成本的平衡。
  • 英伟达把 OCS 纳入新一代架构、并计划在多机架 Scale-up 架构中用于机架间光互连,意味着 Scale-up 正在成为 OCS 的全新市场。

易混辨析

与 Scale-out 的区别 Scale-up 在域内把加速器连成一台机器,最看重带宽密度与时延,用 NPO/CPO;Scale-out 通过组网增加节点数量,最看重成本与互通,用可插拔模块。
与 Scale-across 的区别 Scale-across 跨越数据中心边界,靠 DCI 与相干传输,关注距离与容量,量级与 Scale-up 完全不同。
← 上一个词条ZR / ZR+ 可插拔相干 下一个词条 →Scale-out / Scale-across