ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

光模块、光引擎、OCS与FAU:数据中心光互联技术演进深度解析

光模块、光引擎、OCS与FAU:数据中心光互联技术演进深度解析 这些年做数据中心网络和高速互联相关的项目有一个感受特别深很多搞了好几年网络的人面对“光”这个话题依然容易犯怵。大家习惯了电口的生态RJ45、双绞线、网卡、交换机端口概念清清楚楚一旦换成光模块、光纤跳线再往上接触到光引擎、OCS、FAU这些名词就常常一头雾水感觉像是隔着一层雾。这层雾不捅破后面做AI集群、做超大规模算力互联、做低功耗网络方案的时候会非常难受。因为这几个词根本不是孤立的概念而是同一条产业链上从器件到系统的完整演进路径。光引擎解决的是“怎么把电变成光”的物理极限问题光模块是当前最主流的“光电转换”封装形态光纤解决的是“光怎么低成本远距离传输”OCS解决的是“光能不能替代交换机做灵活调度”FAU则是把光纤和光学芯片精密耦合的关键结构件。这篇文章我打算用一条完整的逻辑链把它们串起来讲。我不喜欢堆术语更愿意用做工程的实际视角把每一个概念背后“为什么要这么做”讲明白。你会看到这些名词之间不是并列关系而是层层递进的关系理解了这条链再去选型、看方案、排障思路都会清晰很多。1. 为什么是“光电”而不是“电电”逼近物理极限后的必然转身先聊一个最基础的问题为什么非要光电信号用了几十年双绞线、背板、PCB走线大家都熟得不能再熟为什么现在整个行业都在朝光的方向走核心原因有三个全是物理层面的硬约束。第一是损耗问题。电信号在线缆和PCB铜箔上传输时损耗和频率强相关频率越高损耗越大而且这个衰减不是线性的是指数级的。比如100G SerDes的信号在常规PCB板材上走15厘米损耗就能到10dB以上眼图直接糊成一团。到了112G/lane甚至224G/lane的时代铜走线的极限传输距离被压缩到只有几厘米。所以“电”不是不能用而是到了高频段它的距离天花板太低。光不同光在光纤里的损耗极低单模光纤每公里损耗大概在0.2dB左右差距是数量级的。第二是带宽潜力。电信号的带宽受限于导体的趋肤效应和介质的介电损耗想要增加带宽就得用更高级的板材、更精密的连接器、更复杂的均衡算法每一步都是成本黑洞。光的载频极高单根光纤的理论带宽在Tbps级别目前商用已经做到单纤100G×80波也就是8Tbps级别这个量级电是完全做不到的。第三是功耗和散热。这个对于数据中心最实际。高速电信号在PCB上每传输一厘米就需要额外的转接驱动和均衡电路来保证信号质量等于是在为“距离”付电费。而光传输大部分功耗发生在光电转换的两端中间纯光传输几乎不耗电。这也是硅光、CPO这些技术火起来的根本原因——把电信号送出芯片之前在封装内就近转成光省掉长距离铜走线的驱动功耗。打个比方大家就懂了电信号就像声音在空气中传播隔一堵墙基本就废了光信号像光线在真空中传播穿过几公里损耗也微乎其微。网络架构从“电电互联”走向“光电混合”本质就是向物理规律妥协——我们不可能无限压榨铜的剩余价值但光的潜力还远没挖完。理解了这一点再看光引擎、光模块、光纤、OCS、FAU这五个词你就会发现它们全是在回答同一个问题的不同环节如何更好地完成“电-光-电”转换和传输。2. 光模块与光引擎从“谁来发光”到“怎么发光”2.1 光模块拆开看一个完整的光电转换王国光模块是大家接触最多的概念也是最容易踩坑的地方。QSFP-DD、OSFP、SFP、CFP一堆封装名词看上去很复杂但本质无非是“速率、体积、功耗”三者之间的博弈。我们以最常见的QSFP-DD为例拆解一下。QSFP-DD全称是Quad Small Form-factor Pluggable Double Density中文是四通道小型可插拔双密度。它的物理接口分成两排金手指每排4个高速通道总共8个通道。如果每个通道跑50G整个模块就是400G如果每个通道跑100G就能到800G。目前400G QSFP-DD模块已经很成熟800G的也开始上量这是当前数据中心的主力选手。光模块内部包含的组件按功能分成三大块光发射单元激光器激光器芯片 驱动电路 调制电路。激光器负责产生光驱动电路负责把差分电信号加到激光器上。根据调制方式不同有直接调制激光器DML和外腔调制激光器EML两种。DML简单但适合短距离EML适合长距离和高速率因为它的啁啾特性控制得更好。光接收单元光电探测器PD/APD 跨阻放大器TIA 限幅放大器LA。光信号打到探测器上产生微弱电流TIA把电流转化为电压LA再把电压幅度整形成数字信号。APD雪崩光电二极管内部有倍增效应灵敏度更高适合长距离场景。数字管理单元MCU 存储器 温度控制。光模块不是傻乎乎的发光就行它需要监测温度、偏置电流、发射光功率、接收光功率这些信息通过I2C接口上报给交换机这就是我们常说的DDMDigital Diagnostic Monitoring信息。没有这个功能光模块出现劣化的时候你根本无法提前感知。这里提一个实际经验很多人不明白为什么同样标称为400GDR4模块和FR4模块价格差那么多。区别在于并行光纤方案和粗波分方案。DR4是4路并行用MPO-12接口传输距离500米左右FR4是4个波长复用到一根单模光纤上用LC双工接口传输距离2公里。FR4对激光器的波长稳定性要求高还多了WDM波分复用器件成本自然高。如果你只是机柜内互联硬要用FR4那就是花钱买不需要的能力。2.2 光引擎新一代的“发光核心”再来说光引擎。这词最近两年高频出现其实它不是指某个具体产品形态而是一类高度集成的光电转换核心组件。传统光模块是独立封装里面有PCB板、激光器、探测器、驱动芯片整体插在交换机面板上。光引擎不一样它的思路是把激光器芯片、调制器、探测器、光波导全部集成在一个非常小的封装里直接和交换芯片放在同一块基板或者尽可能靠近交换芯片。也就是我们常说的CPOCo-Packaged Optics共封装光学技术路线。为什么要这么做核心驱动力是功耗和信号完整性。你看现在一个800G的可插拔光模块功耗能做到16W甚至更高。交换机面板上插64个800G模块光模块总功耗就超过1千瓦产生的热量全部积在设备前端散热压力极大。而且模块和交换芯片之间的高速电信号需要穿过PCB走线从交换芯片引出到面板这一段走线损耗在高速率下非常致命。光引擎把光模块的“内脏”拿掉直接放在交换芯片旁边电信号只需要走非常短的距离然后就地完成光电转换光信号再通过光纤引出。这样有两个好处第一省掉了长距离高速PCB走线的均衡和驱动功耗第二整个封装的体积比可插拔光模块小得多面板上不需要那么大开口风道更顺畅。这里要澄清一个误区光引擎不等于不发光。硅光引擎内部通常集成了激光器但更常见的方案是“外置光源片上调制”——激光器做成独立的光源模组硅光芯片上只有调制器和探测器。这样做是因为硅本身不发光发光效率很低而磷化铟材料发光效率高但集成度差。所以工程上折中了发光交给磷化铟调制和探测交给硅光各取所长。光引擎这波趋势对网络运维的直接影响就是以后你维护的网络设备可能不再有“光模块”这个概念了取而代之的是“光引擎固定集成在设备里光纤直接通过FAU连接器对接”。这意味着设备故障定位的方式完全变了——以前模块坏了拔插替换就行以后光引擎出问题可能整个线卡都要返修。这也是很多运维老手觉得“新架构不习惯”的原因。3. 光纤与连接器从“多模改为单模”说起3.1 单模和多模的本质区别光模块和光引擎负责把电变成光但光从设备出去之后走的路就归光纤管了。光纤的选择看似简单实际上坑很多。单模光纤纤芯直径9微米和多模光纤纤芯直径50微米或62.5微米的基本区别一句话就能说清多模光纤芯径大可以传多种模式的光成本低、容易对准但模式之间有色散传输距离受限单模光纤芯径小只能传一种模式色散小、距离远但对准和熔接难度更高。早期数据中心以多模光纤和SR光模块为主因为短距离、成本敏感。但现在趋势很明显从400G开始单模的比例大幅上升。为什么因为NRZ升级到PAM4之后多模光纤在100G/lane速率下OM4多模光纤的有效传输距离只剩100米左右而OM3更是只能撑70米。你搭一个稍大一点的机房列头柜到机柜顶部的距离、楼层之间的互联很容易超过这个距离。一旦距离不够多模方案就废了。单模光纤的优势是几乎没有距离焦虑。单模光模块从500米到80公里都有对应方案后续速率升级只需要换模块不换光纤。虽然单模激光器成本偏高但用工程经济账算下来与其布一堆多模光纤然后升级时全部重拉不如直接一步到位用单模省下的施工成本远超激光器差价。3.2 连接器接口选型的几个细节光纤之外连接器也是实际问题。目前最基础的接口是LC双工连接器单芯光纤配对使用适用于标准单模和多模模块而多芯高密度场景用的是MPO/MTP一芯连接12芯甚至24芯光纤。接触过400G DR4模块的同事都知道DR4模块用的是MPO-12接口12芯里只用中间的8根4发4收。而800G DR8模块用的是MPO-16接口16芯全用满。这里就出现了一个兼容问题MPO-12和MPO-16虽然外观相似但核心尺寸和引脚定义不一样不能互相插拔。很多人在部署800G时误用了MPO-12的跳线结果光路根本不通。另一个细节是MPO跳线的极性。MPO接口内部光纤排列有方向性用三个字母表示极性Type A、Type B、Type C。Type A是“直通”排列Type B是一端翻转排列Type C是相邻对翻转。如果收发端模块、配线架和跳线的极性搭配不对光信号根本送到不正确的接收端造成光模块检测不到信号。实际工程中因极性错误导致物理层中断的案例非常常见而且排起来特别费劲因为误码率、收光功率看起来全是好的就是端口起不来。我的建议是买MPO跳线时一定要让供应商标注清楚极性类型并且配线架建议直接选模块式的适配板先把极性固化在模块面板里避免施工人员现场乱接线。3.3 FAU把光纤阵列与光学引擎“对齐”的关键件光引擎、CPO架构越普及FAU这个名词就越躲不开。FAU全称是Fiber Array Unit光纤阵列单元。从结构上看它是一个带V型槽或精密蚀刻沟槽的基板上面嵌着一排间距非常精确的光纤出光端面经过研磨抛光用来和光引擎或硅光芯片上的光波导耦合。这个组件的存在是因为光引擎里的光通道间距极其微小。硅光芯片上的波导间距往往只有50微米到200微米普通光纤跳线是0.9毫米或2毫米包覆根本没有办法直接插到芯片上。FAU的作用就是把裸纤按芯片波导的间距排列好对齐到亚微米级别。FAU的制造精度到底有多夸张这么说吧光纤芯的直径是9微米FAU里光纤芯的排列间距公差要求甚至到正负0.5微米以内。0.5微米是什么概念人的头发直径约70微米0.5微米只相当于头发的百分之一不到。好在目前FAU制造技术已经成熟尤其是树脂填充法和激光切割法良率已经能做得很高。工程上FAU最常见的应用是两种一种是与硅光芯片做端面耦合光在水平方向从芯片波导直接进入FAU的光纤芯损耗小但对准要求高另一种是通过垂直光栅耦合光从芯片表面竖向射出FAU需要以特定角度对准工艺上难度更高但耦合位置更灵活。FAU一旦耦合好了后面就是和普通光纤完全一样的延续所以这块的排障经验大多集中在“耦合点”上——颜色变化、弯曲半径过小、插拔时受力不匀都会在FAU处形成微弯引起额外损耗。4. OCS光层交换的核心逻辑与落地路径4.1 OCS与电交换的根本差异把词拆开OCS是Optical Circuit Switch光电路交换机。全光网络的骨干设备它处理的对象不是比特而是光本身。传统交换机是“电交换”无论外面的接口是光口还是电口信号进来后都要做O-E-O转换光转电、电转光再在电域做转发、查表、排队调度。OCS不走这套流程它直接在光层把一根光纤的光信号导向另一根光纤中间不经过任何光转电的过程。简单说交换机是“看包转发”OCS是“看光路切换”。OCS的核心价值有两个。第一是极低功耗不处理比特不查MAC地址和IP地址纯物理层操作功耗也就几十瓦比电交换机动辄上千瓦低一个数量级。第二是极低时延光经过OCS的时延就是跑几厘米的长度在微秒甚至皮秒量级完全透明传导不需要排队。但代价也很明显OCS只能处理光路的通断和切换不能做逐包调度。交换机可以按每个包的IP五元组做路由OCS只能在建立好的光路上传输预先分配好的业务流。所以OCS适合的是稳定、大粒度、可预测的流量这就是“电路”二字的由来。4.2 OCS在AI集群中的真实角色很多人问OCS到底要用在哪。典型的场景是AI训练集群的“多轮次通信优化”。AI大模型训练时通信模式不是均匀分布的而是分成不同阶段某些阶段卡间通信数据量巨大需要高带宽低时延某些阶段计算密集通信需求下降。用传统电交换机无论哪个阶段所有物理链路都是固定不变的流量怎么走完全看交换机的哈希和路由结果。OCS方案则是在计算节点之上加一层光层调度训练任务开始前由控制平面预先计算好通信矩阵然后控制OCS把对应的物理光纤直接接成一个特定的拓扑。举个例子128台GPU服务器如果按传统方式服务器接入电交换机交换机之间再互联可能一台流量要从A服务器到B服务器需要走好几跳每跳都引入交换机时延和功耗。有了OCS控制平面可以动态把A到B的物理光路直接建立成一条直连通道流量一跳直达没有中间电交换的转发。跑完一轮训练后通信模式变了OCS再动态切换光路建立新的直连拓扑。在实际测试中OCS方案在数据量集中、流量周期性强的大规模AI训练场景可以显著减少网络交换层跳数降低传输时延和功耗。当然不是所有场景都适合OCS比如小包场景、动态高突发流电交换仍不可替代。所以真正落地的是“电交换OCS”混合架构电交换处理小包和突发OCS处理大带宽的稳态流量。两者配合才能实现整体性能最优和能效最优。4.3 OCS的组建形式和排障思路OCS用到的核心器件是什么MEMS微镜阵列。通过静电驱动微小镜面转动把入射光导向不同出射端口。每个镜面都可以独立控制实现N×N的全交叉互联。目前商用OCS单机可支持的端口数从几十到几百交换速度在毫秒量级。这个速度比电交换慢得多但对于“分钟级甚至小时级”的调度需求完全够用。另外OCS本身的排障比较特殊。由于它不解析包内容传统抓包、查MAC表的方法全部失效。通常只能看光功率和丢包位置的链路层告警所以在部署OCS之前一定要确保两侧的节点本身具备完整的DDM光功率监测能力。如果业务中断先看OCS两侧对应端口的光功率是否正常再排查是否切错了光路而不是在电域到处找问题。5. 实操总结一套具体场景的选型与实施心法讲了这么多原理回到最实际的问题如果让我来规划一个中小规模的AI算力集群互联该怎么选我给一个参考方案大家按这个思路去细化。机柜内1米以内用光引擎和CPO形态的交换设备如果现有设备不支持CPO就选400G DR4或800G DR8可插拔光模块配MPO-12或MPO-16接口多模或单模按设备支持情况来推荐单模为后续预留。列间互联10~100米用单模光纤光模块选400G DR4或FR4。距离在500米以内DR4够了超过500米就直接FR4不要犹豫。接线用LC双工或MPO转LC扇出跳线。跨楼层/跨机房100米以上老老实实单模FR4模块或100G/400G ZR类相干模块根据距离来选。光纤用OS2单模最好预留20%芯数余量。整网架构核心层用电交换机保证突发流量和小包性能在中间增加OCS做光层直连通路专门承载训练流量这种大带宽稳态业务。参数计算这块提醒大家认真看光模块的链路预算。比如400G DR4模块的典型发射光功率在-2.9dBm到2.9dBm之间接收灵敏度在-6.4dBm左右中间的通道代价包括光纤损耗、连接器插入损耗和熔接损耗。假设你用了3对法兰跳线每对损耗按0.5dB算光纤加损耗1.5dB加起来就是3dB。发射光功率取0dBm到接收端就是-3dBm还有3.4dB余量可行。但如果跳线质量差、端面划伤多损耗翻倍链路就不稳了。每条链路的光功率预算都要这样算清楚别只看模块标称距离。日常维护要注意的事整理成几条速查光纤端面脏是头号杀手。插拔前必须用专用清洁笔和检测仪检查端面不要拿纸擦更不要用手摸。光模块收发口后面的防尘帽不插光纤时一定要盖回去进灰之后激光器发射功率衰减很难恢复。布放光纤时弯曲半径不能小于光纤直径的20倍皮线光缆也不要硬折否则微弯损耗会让你难排查到怀疑人生。OCS光路切换前一定要确认目标光路空闲否则两条业务怼到同一条路双向光功率互相干扰直接闪断。关于光模块和光纤搭配我见过大量问题出在“速率对不上”上。有些接入交换机是10G的SFP光口你硬插一个25G模块可能不亮或者报链路震荡。25G SFP28模块兼容10G一般没问题但反过来10G模块插25G口不一定能协商到10G要看交换机支不支持。部署前老老实实查兼容性列表在线命令查光模块的型号、速率、序列号不要等到业务中断才想起这茬。另外对FAU和光引擎这种集成度高的组件一定要在设备上电前做端面检查。有些设备出厂时接口防尘盖是黑塑料片掀开时可能把FAU端面蹭花。端面一旦划伤小则增加插损影响光功率裕量大则直接烧毁激光器发射口。这个细节很少有人提但现场翻过车的人都知道痛。6. 一些真实体会与扩展思考讲了这么多把我在几个项目里真实踩过的坑和体会也顺便分享一下。第一个体会是光通信的排障很多时候不是技术难而是“隔行”造成的理解偏差。电域排障有协议分析仪有端口计数器有抓包工具光域排障只有光功率计、OTDR和插损仪。这套工具方法论和电域完全不一样。很多人习惯性拿电域的思维方式去查光路明明光功率告警了还去翻MAC地址学习表这就南辕北辙了。正确的第一反应永远是先确认物理层正常——光口发光、光纤连通、接收光功率在范围内。第二个体会是从电到光的转型不是简单的“换线换模块”而是整个运维习惯和故障定位思维的改变。可插拔光模块时代故障定位到模块端口就够了拔插替换完事光引擎和CPO时代你面对的是不可拆卸的光学系统很多情况下必须依赖设备自带的BIST内建自测功能来定位光路故障。有些厂家已经支持对光引擎的每个通道做自测和环回测试大家拿到新设备第一件事应该是把这些诊断功能摸熟而不是等到用的时候再临时翻手册。第三点关于OCS我想多说两句。这技术很有前景但千万别把它当万能药。OCS解决的是“流量的平均问题”解决不了“瞬时拥塞问题”。你的业务如果是以大量小包交互为主那OCS不仅帮不上忙还会因为切换光路引入额外的等待时延。架构设计时一定要先做流量画像把业务分成“大象流”和“老鼠流”大象流交给OCS老鼠流交给普通交换机组。这跟交通规划一样城市快速路管的是大宗客流社区小路管的是零散出行两条路各司其职才顺畅。最后再分享一个经验关于“链路预算”这件事。我一直建议团队里的新人在部署前把每条链路的光功率收发值记录在案包括端口编号、模块型号、光缆走向、熔接点数、法兰跳线对数。业务出问题的时候这套记录是最可靠的参考基准。有一次我们排查某个端口频繁误码比对记录后发现收光功率从-5.2dBm降到了-9.8dBm接近灵敏度门限最后顺着光缆查到一个被机柜夹住的光纤冷接头重新熔接后恢复正常。没有基准记录这种隐性劣化问题排查起来至少多花三四倍时间。从电到光从光模块到光引擎从光纤到OCS整个链条已经把数据中心网络推到了新的物理极限。理解这条链路里的每一个环节你就不会在新技术面前发怵。这套逻辑想通之后看设备、选型、排障都能快人一步。
返回列表