定义
在单个计算域内扩展规模,用高带宽低时延互连把大量加速器连成一台「超级计算机」。
大白话 让几十上百张 GPU 像一颗芯片一样协同干活,通信必须又快又近。这是光互连眼下最值钱的战场。
图解
三个「扩展」的边界 三个扩展的物理尺度不同,因此对应的技术栈也不同:Scale-up 用 NPO/CPO(最看重带宽密度与时延),Scale-out 用可插拔模块(最看重成本与互通),Scale-across 用相干与 DCI(最看重距离与容量)。写稿时把这三层分开,术语就不会乱用。
超节点内部互联 超节点把原本靠机架间组网完成的横向扩展,收进单个机柜内完成,用光引擎做托盘之间的全连接。距离只有一两米,但带宽密度极高——这正是 NPO/CPO 最核心的落地场景,也是「Scale-up 是当前最值钱的战场」这句话的来源。
说明
Scale-up(纵向扩展)指在单个「域」内把大量加速器连成一台逻辑上的超级计算机,使它们可以像访问本地内存一样高速通信。它对带宽密度与时延的要求是所有场景中最苛刻的。
Scale-up 之所以是当前光互连最值钱的战场,是因为它的瓶颈恰好是铜最不擅长的地方:域内连接数量随加速器数量平方增长,距离虽短但总带宽需求极高。当规模扩大,铜的功耗与信号完整性问题迅速放大,光互连成为必要选项。
技术上,Scale-up 域内的互连主要靠 NPO/CPO 光引擎承担(超节点就是典型实现形态),协议层则涉及 NVLink/NVSwitch、UALink 等专用互连。与 Scale-out 不同,它更看重带宽密度与时延,而不是互通性与成本。
关键数字
域内全连接拓扑特征
带宽密度 / 时延首要考核指标
NPO / CPO主要技术路线
关键要点
- Scale-up 域内对带宽密度与时延的要求最苛刻,是 NPO/CPO 与光引擎的主要落地场景。
- 2026 年国内厂商已发布面向 AI 集群 Scale-up 的 6.4T 硅光单模 NPO 光引擎。
- 与 Scale-out 形成对照:Scale-up 追求域内极致互连,Scale-out 追求规模与成本的平衡。
- 英伟达把 OCS 纳入新一代架构、并计划在多机架 Scale-up 架构中用于机架间光互连,意味着 Scale-up 正在成为 OCS 的全新市场。
易混辨析
与 Scale-out 的区别 Scale-up 在域内把加速器连成一台机器,最看重带宽密度与时延,用 NPO/CPO;Scale-out 通过组网增加节点数量,最看重成本与互通,用可插拔模块。
与 Scale-across 的区别 Scale-across 跨越数据中心边界,靠 DCI 与相干传输,关注距离与容量,量级与 Scale-up 完全不同。