数据中心这两年的变化,一句话概括就是带宽一路狂奔。100G刚铺开没多久,400G开始上量,800G已经在头部云厂商和智算中心规模部署。数据中心的网络工程师,绕不开的一个课题就是光互联,800G时代要懂什么,这篇捋一捋。
先说为什么速率涨这么快。AI大模型训练是头号推手。一个智算集群动辄几千张加速卡,卡间通信量是传统业务的量级式增长,网络的速率跟不上,显卡就在那空转烧钱,算力就浪费了。所以从400G到800G的迭代,本质是算力需求倒逼的结果。随之而来的,是数据中心里光模块的数量和单口速率双双飙升,光互联从"连接手段"变成了"核心成本项",有测算说大型数据中心里光模块的投资占比已经相当可观,这直接改变了网工的知识要求。

800G光互联,网工具体要懂什么?第一层是光模块的基本功:速率等级的演进谱系,从10G、25G、100G、400G到800G各自的应用位置;封装形态,QSFP、OSFP这些名字要能对上号;传输距离的档位,SR多模短距、DR单模500米、FR/LR更长距离,选型的时候距离和成本是绑定的。第二层是高速信号的工程问题:800G的信号完整性对线缆和连接器的要求极高,DAC、AEC、光模块之间的取舍,功耗和散热怎么权衡,这些都影响机柜的设计。第三层是组网架构:800G端口用在哪里,是东西向的GPU集群互联、Spine-Leaf的骨干层,还是出口互联,不同位置的速率组合是不一样的。第四层是新技术趋势:LPO线性驱动、CPO光电共封装这些方向,即使暂时用不上,看方案的时候要能听懂。
对一般网工来说,这些内容听着远,其实离得比想象中近。一线城市的数据中心岗位、云厂商的基建团队、智算中心的建设项目,都已经在按800G的规格做规划。就算你目前守的是企业园区网,市场的传导也是实在的:智算中心建设拉动了对高速网络人才的争夺,懂RoCE无损网络、懂高速光互联的工程师在市场上是被抬价抢的,这类人才的薪资水平明显高于传统运维岗。
怎么补这块知识?给个循序渐进的路径。先把基础打牢:光模块的原理、分类、命名规则,这部分在H3CSE、H3CIE的课程里都有涉及,尤其是数据中心方向的考纲,VXLAN、RoCE这些跟高速互联是配套出现的。然后动手做功课:主流厂商的光模块选型手册、数据中心的白皮书,都是公开材料,花几个周末精读,专业词汇就过关了。有机会摸真机的,多在实验室里看光模块的收发光功率、做链路诊断,这些操作技能到哪个数据中心都用得上。
要说入行的窗口期,现在正好。国内智算中心的建设潮还在爬坡,800G的部署是未来几年的确定性主线,人才供给还没跟上。系统学习方面,像润天教育这类机构的数通课程里,数据中心网络技术是重要模块,配合真机实验把光互联的相关操作练熟,面试智算中心或者云厂商的岗位时,简历上这些关键词是实打实的敲门砖。
带宽的军备竞赛短时间停不下来,跟着速率升级走的人,饭碗也跟着升级。