资源描述
FUTURE NETWORK
DEVELOPMENT CONFERENCE
NANJING · CHINA
/ 中国 · 南京
未来网络技术发展系列白皮书(2025)
算力城域网白皮书
(2025版)
第九届未来网络发展大会组委会
2025年8月
编写说明
主要编写单位:
中国电信股份有限公司研究院
华为技术有限公司
全球固定网络创新联盟
中关村超互联新基建产业创新联盟
主要编写人员:
中国电信股份有限公司研究院:朱永庆、胡泽华、龚霞、袁世章、 阮科、陈迅、杨冰、赖道宁、胡家元、张帆、皮谭昕。
华为技术有限公司:任广涛、曾毅、李智、赵浩宾、陈卓、于凤 青、张潇潇。
中关村超互联新基建产业创新联盟:袁博。
算力城域网白皮书(2025 版)
前 言
2025 年初 DeepSeek 的爆火掀起了生成式人工智能的浪潮,带动 大模型训练成本和推理成本的快速下降,驱动算力需求爆炸式增长。 城域网络作为用户与算力资源间的关键桥梁,各类新兴算力业务对城 域网的网络架构、网络能力及服务模式等方面提出了新的要求。中国 电信在 2024 年发布了《算力城域网白皮书》,首次提出算力城域网 概念,获得业界的广泛关注,引领了城域网络发展新方向。伴随着产 业生态与技术的发展,以及算力城域网研究与部署的深入,中国电信 推出《算力城域网白皮书(2025)》,进一步明确城域网络在面向算 力业务新场景、新需求下需具备的网络架构和关键技术能力。
本白皮书首先从算力产业发展、宏观政策以及服务模式等角度分 析了算力发展态势,引出了算力城域网的概念;然后,针对算力业务 需求展开分析,明确了算力城域网应具备的网络能力;其次,分析了 算力城域网设计目标,阐述了算力城域网的总体架构、关键技术和设 备能力;最后,给出了算力城域网面向具体业务场景的技术方案,以 及演进路径建议。
本白皮书旨在通过对算力城域网的网络架构、关键技术、应用场 景及发展策略的探讨,吸引更多行业内的专家和相关从业者共同参与 算力城域网的创新发展与产品实现,推动网络向更加高效、智能、灵 活、绿色、安全等方向演进。
I
算力城域网白皮书(2025 版)
目 录
前 言 I
目 录 II
一、引言 1
二、算力发展态势 2
2.1 算力产业发展和政策趋势 2
2.2 城市算力通过算力城域网就近服务本地用户 4
三、算力城域网需求 6
3.1 需求总述 6
3.2 网络能力需求 7
四、算力城域网总体架构 13
4.1 算力城域网架构设计目标 13
4.2 算力城域网总体架构 15
4.3 算力 POD 16
4.4 云网 POP 16
4.5 出口功能区 17
五、算力城域网关键技术 18
六、算力城域网设备能力要求 22
七、算力城域网典型应用 26
7.1 海量数据高效入算场景 26
7.2 存算分离拉远训练场景 27
II
7.3 跨集群协同训练场景 29
7.4 云边协同训推场景 30
7.5 推理下发场景 31
八、总结与展望 33
附录 A:术语与缩略语 34
参考文献 36
III
一、引言
数字经济已经成为全球经济发展的强大引擎,世界各国都在积极 推进数字化经济新质生产力的建设。算力作为数字经济时代的核心生 产力,正在加速数字经济和实体经济的深度融合。以 AIGC 为代表的 人工智能大模型快速崛起,推动了算力需求的快速增长。
AI/HPC 等高阶算力对于提升国家、区域经济核心竞争力的重要 作用已经成为业界共识。2025 年 3 月,《政府工作报告》提出将持 续推进“人工智能+ ”行动,打造具有国际竞争力的数字产业集群。 这意味国家将加强顶层设计,加快形成以人工智能为引擎的新质生产 力。随着这一行动的深入推进,人工智能将在推动产业升级、促进新 质生产力快速发展等方面发挥重要作用。
随着人工智能技术的快速发展,大模型训练对算力的需求呈指数 级增长,促进了运营商、政府、行业和企业进行算力中心的建设。各 类算力资源如何实现高效整合,服务于千行百业,进而实现算力的商 业闭环是业界普遍关心的话题。本白皮书针对算力发展新态势和算力 业务新需求,在 2024 年《算力城域网白皮书》基础上,对算力城域 网的网络需求、网络架构、应用场景和关键技术等方面进行了更新和 完善,旨在应对算力快速发展带来的各种挑战,实现城域范围内异构 算力的资源整合和高效供给。
1
算力城域网白皮书(2025 版)
二、算力发展态势
2.1 算力产业发展和政策趋势
随着通算、智算、超算技术的快速发展和广泛应用,算力需求呈 现爆炸式增长。2025 年以来,以大语言模型 DeepSeek 系列为代表的 人工智能,通过算法创新与工程优化解锁了更高的算力利用率,实现 训练成本与推理成本的显著降低,加速人工智能的落地部署与普惠化 发展,进一步催生了大量算力需求。根据《IDC 中国加速计算服务器 半年度市场跟踪报告》 分析 ,2025 年中国智能算力规模将达到 1037EFLOPS,预计到 2028 年将达到 2782EFLOPS,五年年复合增长 率达到 46.2%。依托超大规模市场优势,我国算力水平和供给能力大 幅提升,形成了体系完整、规模庞大的产业体系。
我国高度重视算力产业与技术的发展,中央及各级地方政府出台 了一系列政策文件以引导其健康发展。例如,《数字中国建设整体布 局规划》指出要系统优化算力基础设施布局,促进东西部算力高效互 补和协同联动,并通过推动建设普惠算力、推动算力一体化服务等方 式,降低中小企业用算成本。《数字中国建设 2025 年行动方案》提 出开展“人工智能+ ”行动,深度挖掘应用场景,建设高质量数据集, 目标到 2025 年数字经济核心产业增加值占 GDP 比重超 10% 。《算力 互联互通行动计划》指出集中力量开展高性能传输协议等网络传输技
2
算力城域网白皮书(2025 版)
术研究,推动数据通信产业高质量发展,加快高性能路由器、高速无 损网络技术研究,支撑数据高效入算、算力无损互联。攻克算力标识 关键技术,研制新型算力标识网关,提高多样化算力感知能力。
大模型是指具备大规模参数和复杂计算结构的机器学习模型,能 够处理海量数据、完成各种复杂的任务,包含语言大模型、视觉大模 型等多种类型。大模型的快速迭代极大地增加了智算算力需求。根据 应用领域的不同,可分为通用大模型、行业大模型和垂直大模型等。 通用大模型不受特定领域的限制,具备跨领域的泛化能力,需要更大 的数据量和计算资源,训练成本普遍较高。行业大模型和垂直大模型 专注于特定行业或应用场景,表现出更高的专业精度和深度,算力要 求和训练成本也相对较低。大模型部署可分为训练和推理两种场景: 训练场景是指使用大规模数据集对庞大、复杂的大模型参数进行训练 的过程;推理场景是指在特定条件,利用大模型进行逻辑推理、知识 推断提供高效准确结论的过程。
对于大部分企业和研究机构来说,自行购买和维护高性能计算设 备训练大模型需要投入大量的人力和物力。在这个背景下,算力租赁 服务应运而生。算力租赁通过即插即用的弹性解决方案,降低了算力 获取难度和使用成本。企业的信息化和智能化转型可以通过算力租赁 更快捷地获取所需的算力资源,从而加速技术研发和创新。当前,算 力租赁服务已成为主流解决方案,不仅降低了算力使用的门槛,推动 了算力技术的普惠化发展,更改变了算力资源的配置方式,为算力服 务的广泛应用和持续创新提供了强有力的基础设施支撑。
3
算力城域网白皮书(2025 版)
2.2 城市算力通过算力城域网就近服务本地用户
面对算力产业快速发展趋势,中国电信推出了面向智算的新一代 数据中心(AIDC,Artificial Intelligence Data Center)基础设施技术方 案,在高算力规模、高功率密度、高弹性需求背景下,同时兼容通算、 超算、智算,甚至未来的量子算力。在 AIDC 基础上,中国电信积极 布局算力基础设施建设,面向政府、企业、科研机构等提供就近的高 效算力服务。除了围绕热点区域建设“2+3+7 ”1的公共智算云池,还 重点在各省打造(N 个)城市智算基础设施服务当地用户,满足数字 政务、城市大脑等城市数字化转型场景;通过(M 个)行业智算集群 服务教育、电力、金融、互联网等重点行业;并基于地市边缘节点(X) 按需将推理算力向边缘覆盖。
中国电信云化 IP 城域网(简称为新型城域网)具备原生算力业务 高效承载的能力,基于云网 POP 灵活架构以及城域 Spine-Leaf 的 Full-Mesh 组网优势,实现了云边/边边高效协同和算网快速对接。面 向算力业务的长期演进,中国电信通过引入算力灵活调度、算力无损 传输、精准流级调度、网络智能运维等能力,打造以算力为中心、算 网一体的城域网新业态——算力城域网2 。当前,中国电信在上海、 浙江、广东等地围绕海量数据弹性高效入算、存算分离百公里拉远训 练、百公里分布式推理等新型智算业务开展算力城域网现网验证,实
1 “2 ”是指中国电信在内蒙古、贵州设置的两大公共训练智算中心;“3 ”是指中国电信在北京、上海、 广州设置的三大热点区域智算中心;“7 是 ”指中国电信在安徽、宁夏、湖北、江苏、辽宁、重庆、浙江 设置的七大区域训练智算中心。
2 算力城域网:Computing service Oriented Metropolitan Area Network(COMAN)。
4
算力城域网白皮书(2025 版)
验结果表明算效、TTFT 、TPOT 等指标劣化小于 3% ,充分证明算力
城域网方案的技术可行性。
算力城域网具备算力高效整合、算力无损输送、算力服务即取即 用等关键能力,通过构建 AIDC 与用户之间的安全高速通道,支撑城 市算力和行业算力就近服务本地算力用户。算力城域网通过高弹性、 高吞吐、高可靠的一跳入多算等网络新型服务能力,为政府、企业、 科研机构各类客户提供高效便捷的算力服务,加速数字化转型进程, 支撑数字经济的高速发展。
5
三、算力城域网需求
3.1 需求总述
典型算力业务流程包含数据入算、模型训练、模型推理几个关键 阶段。数据入算阶段要求网络能够满足 TB/PB 级海量数据的高效传 送。考虑到数据敏感用户的数据“不落盘 ”要求,还需要网络具备高 稳定和数据无损传输能力,实现用户私域存储与 AIDC 之间的高效拉 远训练。模型训练阶段当前面临单 AIDC 算力资源受限、零散算力资 源未利用等问题,亟需通过分布式协同训练实现算力资源高效整合, 要求网络提供无损、高吞吐的高性能算间互联。模型推理阶段包含推 理结果生成和推理结果下发两个关键步骤:推理结果生成需要大量算 力资源以保证海量用户并发推理体验,网络需具备无损传输、高可靠 能力,满足分布式推理需求;推理结果下发需要保障用户的泛在接入 与实时交互,要求网络具备广覆盖及确定性服务能力。
算力城域网作为连接用户与算力资源的关键桥梁,为算力租赁服 务提供了关键的网络支撑,确保租用算力资源的企业可以获得接近本 地部署的算力使用体验,需要高效满足海量数据入算、存算分离拉远 训练、跨集群协同训练、云边协同训推、推理下发等算力业务需求。
6
算力城域网白皮书(2025 版)
-
3.2
3.2. .
, ,
企业 。
发布 , -
202 , , .
数据,到 2029 年将增长一倍以上达到 527.47ZB;其中,中国市场 2025 年将产生 51.78ZB 数据,到 2029 年增长至 136. 12ZB ,CAGR 达到 26.9%。众多企业当前仍依靠邮寄硬盘的方式进行大规模数据的搬运, 诸如科研、交通、影视、医疗等领域,每年都有 PB 级数据通过硬盘
7
算力城域网白皮书(2025 版)
搬运/邮寄方式传送到算力中心进行模型训练。这种“人工拷贝+硬盘 快递 ”的模式不仅效率低,还面临着硬盘损坏与数据丢失的风险。当 前基于网络传送的方案仍存在不足,百兆专线耗时长,而万兆专线 /OTN 专线成本高,亟需对网络进行升级,提供更为高效且具性价比 的数据入算服务。
8
力,
提供
式服
求。
TB
达);
3.2. .
。
,
,
, ,
, ,
,
, 、
, 。
:
、
。
涉及 , 、
息及 , 、
序列分析等敏感信息,这些数据均具有较高的安全标准。在算力租赁 场景中,这些企事业单位对样本数据有严格的安全标准,明确要求核 心数据存储在其所在园区或单位内。这些企事业单位在坚持数据本地 化存储原则的同时,还需要确保数据在模型训练过程中不被泄露。因
算力城域网白皮书(2025 版)
此,算力资源节点与样本数据存储节点需要跨广域部署,并且在模型 训练时需要保持频繁的实时交互,以分批拉取所需的样本数据。
在此场景下,由于样本数据传输采用对时延、丢包高度敏感的 RDMA 协议,网络除了要具备高弹性、高吞吐能力外,还需要具备 RDMA 无损传输能力,以确保模型训练的高效性和稳定性。此外,
9
网络
私域
损传
保障;
带宽
3.2. .
100
考虑
制约,
练,
,
:
,
,
-
;
,
。
,
,
、
,
。 ,
。
。
规模普遍偏小(规模为 100-300 PFLOPS 的小型智算中心占比超70%), 并且往往分散在不同的数据中心、科研机构、地方政府和云服务商。 因此,整合零散的社会算力有助于打破地域、机房资源、服务商等限 制,构建统一、高效的算力服务平台。
算力城域网白皮书(2025 版)
跨集群协同训练对网络带宽 、 时延要求高 , 网络需具备 400G/800G 大带宽链路以及 RDMA 无损传输能力,避免算力传输过 程中出现拥塞、丢包。同时,考虑到训练参数同步时流量大并发、高 突发特性(以万卡级 AIDC 为例,单网卡 200Gbps 的传输速率将导致 参数面突发流量峰值高达 2000Tbps),需按照最优收敛比建网,平
10
衡算
引发
网络
400
RD
8:1、
3.2. .
。
,
,
、
,
。
-
;
,
,
一
、
:
。
。 、
, 。
,
训推一 。 ,
难、 ,
需求。 , ,
满足企业算力资源灵活扩展需求,成为更高效、便捷且兼具性价比的 方案。云边协同训推方案基于 Split Learning 部署模式,将模型切分 到本地和云端算力资源池中并行处理,并结合输入、输出层的本地化 部署,保证样本数据不出园区,满足了金融、医疗等数据敏感客户的
算力城域网白皮书(2025 版)
数据安全要求。此外,该方案与 Prefill-Decode 分离式推理架构天然 适配,通过将可弹性扩展的 Prefill 和 Decode 分层部署在本地和云端, 显著提升推理效率、资源利用率和用户体验。
在此场景下,本地和云端算力池之间基于 RDMA 协议传递参数 面同步数据、KV Cache 等信息,要求网络在保证高吞吐、低时延的
11
前提 , 网络
要求 ,
,
载均
和 ;
多租 。
3.2. .
为预 智能
推理 、
, 、 。 ,
,
。
:
, ,
,
。
, 、
。
,
提出了更高的要求,以确保用户体验推理业务的流畅。
为了满足推理下发对低时延、高带宽及确定性的需求,网络需要 实现泛在覆盖与便捷接入,确保用户能够享受一致的服务体验。同时, 网络还需具备确定性服务能力,能够精准识别并优化数据传输路径,
算力城域网白皮书(2025 版)
提高数据传输的确定性和可靠性,从而满足用户的实时交互需求。
综上,推理场景对算力城域网的需求是:泛在接入各种算力用户, 满足百万级用户的并发带宽需求;具备确定性服务能力,对于时延敏 感类业务确保 RTT 小于 10ms;对数据敏感的行业和政企用户,需要 基于网络切片实现推理业务数据的安全隔离。
12
算力城域网白皮书(2025 版)
四、算力城域网总体架构
算力城域网是中国电信从云网协同到云网融合战略的具体实践, 通过 "算力 ”、"云 ”和 ”网"在基础设施层的融合,实现"算力 ”、" 云 ”和“ 网 ”在逻辑架构、资源管理和服务调度方面的逐渐融合,支 撑云网融合的算网产品和服务的持续创新。算力城域网依托新型城域 网的架构优势,构建以算力为中心、算网一体的新服务、新平台、新 形态。
4.1 算力城域网架构设计目标
(1)凝聚算力,共筑生态
l 联接智算、通算、超算、量子、安全等数字能力,实现算网多 要素融合、多能力一体化服务。
l 联接 DC 、自有云、三方云、社会算力、IT 生态,构筑丰富的 业务和应用生态。
l 联接 ToC/ToB/ToH 场景下的海量用户资源,将算力服务和生 态应用引入到千行百业、千家万户。
(2)算网一体、灵活部署
l 沿用新型城域网模块化组网架构,基于 Spine-Leaf 灵活扩展, 泛在接入各类用户。
l 算力网关随 AIDC 灵活部署,构建网络和算力资源的标准化对
13
算力城域网白皮书(2025 版)
接模型,实现网随算动。
l 基于 SRv6/EVPN/网络切片等 IPv6+技术底座,实现对 RDMA 等数据传输协议的统一承载。
(3)算网赋能,使能商业
l 引入弹性带宽、超高通量、广域无损等新技术,支撑存算分离 拉远训练、跨集群协同训练等创新业务和服务。
l 基于大象流自动识别与智能调度,实现网络级智能负载均衡, 达到全网资源利用率最优,提升投资收益比。
l 通过算力业务应用感知和流级精细化调度,支撑差异化算网产 品和服务的商业创新。
(4)智能运维、安全可靠
l 实现高精仿真,消除因配置差错导致的网络事故。
l 打造精细化业务监测能力,实现全网资源与业务实时可视。
l 基于网络实时监测和故障快速感知,实现故障自动定界定位。
l 按用户或业务类型设置网络切片,实现用户数据管道安全隔离。
14
算力城域网白皮书(2025 版)
4.2 算力城域网总体架构
图 4-1 算力城域网(COMAN)总体架构
算力城域网基于算力 POD 、云网 POP 、出口功能区模块化组件 搭建。算力 POD 实现 ToC/ToB/ToH 场景的算力用户统一接入和广泛 覆盖,以及深/浅边缘算力池的快速接入;云网 POP 通过算力网关联 接城域网络与算力资源池,实现二者在参数面、样本面、业务面网络 间的标准化快速对接;出口功能区作为 AIDC 与算力 POD 之间的枢 纽,实现用户数据高效入算,以及多 AIDC 之间的算力协同。
算力城域网通过三大模块化组件之间的高效协同,确保算力业务 在城域内的高效承载。算力 POD 作为用户接入入口,通过与云网 POP 高速互连,构建用户至算力资源池间的高效传输通道;算力 POD 与 出口功能区联动,实现跨 POD/跨域的用户至算力资源池的端到端无
15
算力城域网白皮书(2025 版)
损连接。三大模块均采用 SRv6/EVPN 等标准化技术底座,在确保端 到端业务逻辑一致性的同时,为算力业务提供高质量的网络承载能力。
4.3 算力 POD
算力POD 可根据用户位置、行政区域、AIDC 服务范围等因素 灵活设置,实现算力用户终端、企业分支站点的融合接入,涵盖光纤、 PON 、 5G 等 多 种 接 入 介 质 。 算 力 POD 基 于 算 力 SPINE 设 备 (COMAN-CR)、算力 Leaf 设备(COMAN-AR)设备构建的 Spine-Leaf 架构,实现固、移、云、算业务的统一接入与融合承载,同时保证了 区域内各类业务流量的无阻塞快速转发。算力 POD 可为用户提供无 损的算力通道,实现算力服务的广覆盖和高效输送;并结合云网 POP 快速接入深/浅边缘推理池,实现边缘算力的池化利用和灵活调度, 为用户提供低时延、高体验的算力服务。
4.4 云网 POP
云网 POP 内部署 COMAN-AR 与算力网关对接,通过城域网络 与算力资源池的标准化、快速对接,实现“小时级 ”算网架构互联、 “分钟级 ”算网业务开通以及ms 级算网业务访问时延,支撑算网一 体化服务。云网POP 作为算力资源池的网络锚点,可接入自有及第 三方异构算力资源池,实现算力资源池化与统一管理;同时通过与省 级或区域COMAN-CR 设备互联,实现跨域算力资源池之间的低时延、 高可靠连接,打通跨域算力协同网络。
16
算力城域网白皮书(2025 版)
4.5 出口功能区
出口功能区作为城域网与骨干网、互联网及行业专网的枢纽,简 化了城域网与外部网络、异构算力资源池之间的连接,实现组件灵活 扩展以及组件间流量高效疏导。其中,Super-Spine 做为流量汇聚节点 联接多个算力 POD ,通过弹性带宽、网络级智能负载均衡等技术承 载样本数据高速入算、存算分离拉远训练等业务;Super-Spine 同时实 现多 AIDC 互联,基于 400G/800G 高速链路、广域无损等技术实现城 域内异构算力的整合和协同调度,支撑算力分布式训练或推理场景。
构建用户到 AIDC 以及 AIDC 之间的高吞吐、无损互联网络是算 力城域网解决方案的设计重点。算力城域网通过引入弹性带宽、高吞 吐调度、高收敛比组网、广域无损、精准流控、智能运维等网络技术 和能力,实现用户到 AIDC 入算业务以及 AIDC 之间联算业务的高效 承载。同时,算力城域网提供租户级网络切片等软/硬隔离技术,为用 户提供安全隔离、确定性保障、高可靠的入算新服务。
17
算力城域网白皮书(2025 版)
五、算力城域网关键技术
算力城域网将算力服务由数据中心机房向广域网延伸,必须具备 相应的关键技术和能力。
(1)弹性带宽能力
企业普遍面临周期性数据传输带来的带宽配置难题:长期采用高 带宽专线会导致闲置期资源浪费,而低带宽专线则因传输时延过长造 成算力资源空转。算力城域网需具备弹性敏捷的带宽按需拆建能力, 可根据用户算力需求的变化动态分配带宽资源,为用户提供 100Mbps 至 100Gbps 的弹性带宽服务。根据企业算力业务需求和运营商网络资 源使用情况,算力城域网可动态调度算力业务流的网络路径,在网络 数据流量波动时仍能提供持续稳定的数据传输服务。
(2)超高吞吐能力
在智算、超算等场景中常常存在大量的大象流,这类流量具有单 流瞬时高速率(10M-100G)的特征。传统基于五元组哈希的负载均 衡技术难以有效应对大象流,容易造成负载不均衡和网络拥塞。算力 城域网引入大象流自动识别与拆分、网络级负载均衡等关键技术,基 于 IB 传输层信息(如 QP 对等)将大象流拆分为多个子流,并结合 智能管控实现全域流量均衡,确保网络链路达到 90%以上的超高吞吐 率。在确保 AIDC 算效高效发挥的同时,实现算力城域网整网带宽和 容量资源的高效利用。
18
算力城域网白皮书(2025 版)
(3)广域无损技术
对于存算分离拉远训练、跨集群协同训练以及云边协同训推等场 景,AIDC 的样本面和参数面数据跨广域传输距离可达百公里甚至千 公里。这两种场景都需要采用RDMA 作为承载协议,提升数据传输 的效率。RDMA 对网络性能非常敏感,0. 1%的丢包将导致数据吞吐 率下降 50%。算力城域网通过引入 400GE/800GE 端口和端口大缓存, 有效降低网络拥塞概率,并结合流级拥塞控制机制,避免算力数据传 输过程中发生丢包。确保跨广域训练的算效相较于单 DC 仍能达到 95%以上,并且云边协同推理相比集中推理 TTFT 和 TPOT 性能劣化 小于 5%。
(4)收敛组网技术
在跨集群协同训练场景下,城域网络需要承载多个 AIDC 间的大 规模参数面数据并发同步。算力城域网需具备收敛组网能力,有效缓 解多 AIDC 协同训练时数据并发和突发对网络的影响:通过分层梯度 聚合算法重构集合通信流程,有效减少跨数据中心通信的算卡数量, 实现网络带宽的初步收敛;再采用“突发缓存+ 队列调度 ”的双重机 制,利用高速缓存吸收流量冲击,并通过优先级调度确保 GPU 控制 信令的及时传输,避免计算资源闲置等待。按需引入 4:1 、8:1 、16:1、
32:1 等网络收敛比,实现建网成本与算效的最优平衡。
(5)模块化组网能力
算力城域网以 AIDC 为中心组网,基于模块化组网架构与 AIDC 标准化对接,实现超算、智算等异构算力的并网与池化调度,灵活适
19
算力城域网白皮书(2025 版)
配不同层级的自有及三方 AIDC 的覆盖服务范围。同时,算力城域网 可根据算力用户接入位置和业务类型,按需升级或新建模块化网络组 件,在敏捷、灵活、泛在接入各类算力用户的同时,保证网络平滑演 进。
(6)一线接入、融合承载能力
算力城域网需构建基于统一协议栈同时承载固、移、云、算多元 化业务的能力,在有效降低网络复杂度的同时,显著提升业务部署和 运维效率;并基于 IP 的灵活连接能力优势,支持企业和行业用户一 点接入,避免开通多种业务时部署多种 CPE,实现一个盒子一根线同 时入网、入云、入算的便捷服务。
(7)超高可靠能力
算力城域网应保证长期稳定,防止因为链路拥塞、光模块故障、 光纤质量下降等故障导致训练的中断。算力城域网需具备租户级故障 隔离能力,实现租户级精准反压,避免故障扩散影响多租户算效。同 时,算力城域网需具备随流检测、高精仿真、网络自愈等智能运维能 力,通过业务流级可视、秒级流量趋势展示、秒级故障感知和逐包故 障定界等技术,实现业务流故障的快速定位与恢复,驱动网络自治等 级从 L3 有条件自治向L4 高级自治演进。
(8)超高安全能力
算力城域网需要构建多层次的安全防御体系,应对多租户环境下 的数据泄露和横向渗透风险。其核心在于实现租户数据的全流程隔离 与端到端加密传输。算力城域网可基于 VPN 与网络切片技术,构建
20
算力城域网白皮书(2025 版)
“接入设备-网络切片-VPN ”三级隔离机制,通过物理层、协议层和 业务层的全维度解耦,有效阻断安全威胁。同时,算力城域网可通过 结合量子加密、区块链等前沿技术,进一步增强网络的安全防护能力, 向“主动免疫、动态感知、全链可信 ”的零信任架构演进。
21
算力城域网白皮书(2025 版)
六、算力城域网设备能力要求
算力城域网设备包含算力网关、算力 SPINE 设备(COMAN-CR)、 算力 LEAF 设备(COMAN-AR)和算力接入 CPE 设备。算力网关是 连接算力城域网与算力资源池的枢纽;COMAN-CR、COMAN-AR 是 算力城域网的综合业务承载核心;算力CPE 设备是算力用户的网络 起点。这些设备作为算力城域网的核心组成部分,在硬件与软件能力 上需满足以下要求,以实现超高吞吐、广域无损、超高可靠以及智能 运维等关键能力。
(1)高速接口
当前,网关设备接口以 10GE 为主,辅以少量 100GE 接口;城域 SPINE 设备以 100GE 、50GE 为主,辅以少量 10GE 接口;城域 Leaf 设备接口以 50GE 、25GE 、10GE 接口为主,辅以少量 100GE 接口; CPE 设备以 10GE 、GE 为主,辅以少量 100GE 接口。
为了适应算力业务高吞吐需求,设备需升级端口能力:算力网关 设备需支持单端口 100GE ,且具备 400GE 演进能力;COMAN-CR、 COMAN-AR 设备需支持单端口 100GE 、400GE ,且具备 800GE 和 1.6TE 演进能力;算力 CPE 设备需支持单端口 10GE 、100GE ,且具 备 400GE 演进能力。
(2)动态大缓存
22
算力城域网白皮书(2025 版)
图 6-1 动态缓存机制示意图
针对广域 RDMA 高吞吐、高突发的特点,算力城域网设备需具 备 GB 级端口大缓存,有效降低网络拥塞概率:一方面平滑因多流汇 聚导致的瞬时速率波动;一方面为 PFC 、ECN 等流控机制提供足够 的反应时间窗口。此外,设备需具备缓存队列动态调度能力,实时感 知业务流量变化以优化缓存分配策略,实现物理资源与业务需求的弹 性匹配,支撑基于 SLA 的精细化业务保障。
(3)大象流拆分及负载分担
单条大象流带宽大、历时长,在与普通数据流混合转发时,极易 出现部分链路拥塞、部分链路空闲的现象。这不仅导致网络全局负载 不均,而且导致因拥塞而出现的 RDMA 报文丢失现象。为此,在基 于五元组识别流的基础上,算力城域网设备需支持识别 RDMA 报文 的 IB 传输层信息(如 QP 对、Partition Key 等),将单条大象流根据 IB 传输层信息划分多条子流。以此为基础,结合 Hash 算法优化实现 基于子流的大象流负载分担,最大化网络吞吐与链路利用率。
23
算力城域网白皮书(2025 版)
(4)流量实时统计与上送
为实现流量的精细化管控,算力城域网设备需具备流状态表,通 过对流/子流的速率、类型、优先级、QP 对等特征的实时统计,识别 需重点保障的业务流和控制流。再基于 Telemetry 技术周期上报功能 将流信息上送到控制器,由控制器为关键流定制最优路径,从而为业 务流提供高吞吐、低时延、低拥塞的传输环境,并保障控制流的可靠、 优先传输。此外,设备在上送流信息时可同时上送资源信息(可用带 宽、缓存队列深度等),支撑控制器统一规划整网流量,实现全网路 径间的无冲突均衡调度。
(5)流级拥塞控制
图 6-2 端到端精准流控表示意图
数据中心普遍采用PFC 机制保障无损传输,但其端口队列级的 粗粒度控制容易引发头阻和误伤问题。算力城域网融合承载固、移、 云、算多种业务,因此更需要具备端到端的流级精准调控能力,避免 因传统拥塞控制机制在广域场景下的滞后与扩散问题带来的吞吐下 降。算力城域网设备需为每个 RDMA 业务流分配独立的缓存队列并 实时监控缓存水位,当队列深度超过预设阈值时,基于端到端/逐跳
24
算力城域网白皮书(2025 版)
回溯方式向上游设备发送流级反压信号,从而实现细粒度的流量控制, 在有效避免拥塞发生的同事,也避免了对其他业务的影响。此外,算 力网关需支持流级精准流控技术与 PFC 之间的优先级映射,实现跨 广域端到端的精准流控。
25
算力城域网白皮书(2025 版)
七、算力城域网典型应用
算力城域网是云化 IP 城域网面向算力新业态的演进,其组网方 案和能力规划需要考虑算网一体化及算力业务创新的长期发展,根据 业务需求,引入弹性高吞吐、高收敛组网、广域无损等能力,以应对
海量 、 、
场景。
7.1
,
周期 。
展开阅读全文