ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

数据中心供配电全链路解析:从市电到机柜的冗余、容量与调试

数据中心供配电全链路解析:从市电到机柜的冗余、容量与调试 上架前最后一个动作永远是蹲在列头柜前面看三相电流是否平衡。这个动作看起来跟技术没什么关系但做过几年机房的人都知道供电这一环出问题前面所有的网络架构、存储冗余、容器编排都白搭。数据中心的供配电系统说白了就是把市电从电网那头一路安全、稳定、可控地送到每一台服务器的电源模块里中间要经过中压引入、变压、不间断电源、末端配电、机柜PDU这几道关。它决定了一个机房能承载多少算力、能扛住几次市电波动、能不能在柴发启动的那十几秒里让业务毫无感知。这篇文章主要面向三类人正在规划机房或者扩容机柜的运维和基础设施工程师、需要评估供配电预算和冗余等级的技术负责人以及自己搭小型机房、想把电这块搞明白的独立开发者。我会把配电链路的每一段拆开讲清楚把容量计算的过程一步步写出来也会分享一些只有真正上过电、跳过闸、被电池报警吵醒过的人才知道的细节。1. 从10kV进线到主板供电一条电要走完的六段路1.1 电力链路拆解每一段都可能是故障点很多人对供配电的理解停留在机房有两路电、有UPS、有柴发这个层面。真正做设计的时候你得把整条链路画出来从城市电网的10kV或者35kV进线开始一段一段往下捋。我把这条链路分成六段中压引入与计量、变压器降压、低压主配电与自动转换、不间断电源、末端配电、机柜级配电。每一段的故障模式、切换时间、维护窗口都不一样混在一起谈供电可靠性是没有意义的。第一段是中压引入。两条10kV线路从上级变电站引过来理想情况是来自两个不同的变电站或者至少是同一个变电站的两段不同母线。这里有个特别容易被忽略的坑很多项目号称双路市电实际上两路是从同一个变电站的同一段母线上分出来的两条馈线。这种情况下上级变电站检修或者母线故障两路一起没所谓的双路供电在关键时刻形同虚设。我在参与过一次电力局计划检修时才真正体会到这一点图纸上看着是两条独立路径实际追溯上去在第三级就合流了。后来我们在设计阶段就要求把上级电源的拓扑图画出来一直追到区域变电站确认两路电源在物理上确实独立。第二段是变压器降压把10kV降到400V。数据中心普遍用干式变压器因为不燃、维护简单、可以放在楼内。变压器的容量、阻抗、接线组别都会影响后面的短路电流和保护配合。这一段通常按N1配置也就是两台变压器各承担一半负载任何一台故障另一台能顶上全部负载。这里要注意的是变压器的负载率不能拉满长期运行在额定容量附近温升和损耗都很难看寿命也会明显缩短。第三段是低压主配电和自动转换。市电进来之后要经过主进线柜、母联柜、馈线柜通过自动转换开关在两路市电之间切换或者在市电和柴发之间切换。这一段是整套系统里动作最频繁的部分也是故障率最高的部分之一。第四段是不间断电源。这是整个链路的核心也是投资占比最大的部分。UPS负责在市电波动、瞬断、切换期间维持输出同时在市电长期中断时靠蓄电池撑到柴发带载。第五段是末端配电包括列头柜、母线槽这些把电分到每一排机柜的设备。第六段是机柜级配电也就是机柜里的PDU和服务器电源模块。后面几节我会逐段展开先把整体架构和分级逻辑说清楚。1.2 可用性分级与配电架构的对应关系行业里有一套被广泛引用的四级可用性分级从基础级到容错级核心区别就在于有没有冗余、冗余是否可同时维护、故障是否自动隔离。这套分级不是拿来贴标签的它直接决定了你的配电架构长什么样、花多少钱。基础级只有一条配电路径没有任何冗余计划维护必须停机非计划故障必然导致业务中断。这种配置现在只出现在测试环境或者对连续性完全没有要求的场景。第二级增加了冗余部件比如N1的UPS模块、N1的变压器但配电路径仍然只有一条仍然存在单点故障维护时还是要停部分负载。第三级可以同时维护也就是常说的双路供电两条独立的配电路径可以轮流检修而不影响负载但仍然可能有短暂的手动切换。第四级是容错级任何一条路径上的任何设备故障负载都不受影响也不需要人工干预架构上对应的是2N或者2(N1)。我给客户做方案时第一句话通常是问业务能接受多长的中断时间。财务结算系统、实时交易、核心数据库这类业务停机一分钟的损失可能比整套2N配电的增量投资还高那没什么好犹豫的直接按容错级设计。而离线训练、批量渲染、日志归档这类任务中断几十分钟甚至几个小时都能接受硬上2N就是浪费预算。这个判断比任何技术细节都重要因为架构一定后面所有设备选型、空间规划、运维流程都跟着定死了改起来代价极大。2. 冗余架构选型2N、N1、DR、RR该怎么定2.1 四种模型的真实差别选冗余模型的时候图纸上的差别很清楚实际运行和维护上的差别才是关键。我逐个说。N1是最常见的起步配置N是满足负载所需的设备数量加一是指多配一套作为备用。比如负载需要三台500kVA的UPS那就配四台任意一台故障剩下三台仍然能满足负载。它的优点是投资相对可控、设备利用率高缺点是系统的总容量中有一部分长期闲置而且如果负载增长超出预期那个1的余量很快就被吃掉了需要提前规划扩容。另外要注意N1能扛住一台设备故障但扛不住一台设备故障的同时另一台在进行计划维护这对运维排期是个约束。2N是指完全独立的两套系统每套都能独立承担全部负载。两个UPS系统、两条母排、两路配电、机柜里两个PDU一路来自A系统一路来自B系统。任何一套完全停运另一套都能顶住。这是容错级的标准做法也是成本最高的做法设备投资基本翻倍而且两套系统的负载率都只有50%左右效率上是有损失的。现在的做法通常是配合模块化UPS让两套系统的模块数量按实际负载动态配置减少闲置。DR是分布式冗余在一些互联网厂商的大型园区里用得比较多。它把负载分成多个独立的模块每个模块内部有自己的配电模块之间通过母联互相支援。相比2NDR的设备总量少一些理论上成本低一些但系统逻辑更复杂切换策略需要仔细设计一旦策略写错支援关系可能反而变成故障传播路径。RR是走线冗余用两套独立的走线路径和配电设备但上游的电源设备是共用的。它可以防止单条线路或单个配电柜故障但防不住上游UPS故障属于一种成本折中。有些项目预算不够上2N又想解决末端单点就会选RR。冗余模型冗余范围能否同时维护主要风险成本占比参考N1设备级受限需排期维护与故障叠加100%2N全路径可以投资高、负载率低170%到200%DR模块级可以逻辑复杂、策略依赖130%到150%RR走线级部分可以上游单点仍在110%到130%表格里的成本占比只是个粗略参考实际差异跟项目规模、设备品牌、机房条件关系很大不能直接拿去当预算依据。我列出来是想说明一件事冗余不是免费的也不是越多越好得跟业务价值对齐。2.2 一笔算清冗余的投入产出我经常被问到底值不值得上2N我的回答是先算三笔账。第一笔是停机成本。把过去一年因为电力原因导致的停机次数和每次的损失估出来包括直接的业务损失、客户赔偿、恢复人力成本。如果一年损失远超2N的增量投资那答案很清晰。第二笔是增量投资的具体构成。从N1升到2N增加的不仅仅是UPS还有变压器容量、低压柜、母排、线缆、末端配电、机房空间甚至柴发的容量也要跟着放大。很多人只算了UPS的差价结果预算超了一大截。我建议在方案阶段就让电气、暖通、土建一起出量把增量成本完整列出来。第三笔是运行成本的差异。2N架构下每套系统负载率低UPS在低负载率下的效率通常低于最佳工作区间长期电费差异不能忽略。以一套2000kVA的系统为例效率差两个百分点一年下来的电费差额是实打实的。另外电池的维护更换也是按组走的2N意味着两倍的电池组。还有个现实问题机房面积。2N架构占用的配电间面积、电池间面积都更大在一些改造项目里空间比钱还难解决。我遇到过一个项目方案做得漂漂亮亮最后卡在电池间放不下那么多组电池只能退回N1加RR的组合。所以架构选型一定要在方案早期就把空间约束摸清楚别等到施工图阶段才发现放不下。3. 关键设备的选型逻辑与实操细节3.1 双路市电、变压器与ATS中压引入这块除了前面说的要追溯电源独立性还有几个实操细节值得说。进线柜的计量方式、保护配置、与供电部门的产权分界点都要在前期谈清楚不然验收的时候会扯皮。中压柜的体积和操作通道要求也影响配电间布局手车柜和固定柜的维护空间差别不小做平面布置的时候要留够。变压器选型干式变压器是主流关注三个参数额定容量、短路阻抗、温控方式。短路阻抗一般在6%左右阻抗小则短路电流大对开关和母排的动热稳定要求高阻抗大则电压调整率大末端压降可能超标。温控要带超温报警和跳闸而且要确认跳闸信号是送到监控还是直接跳闸这个设置直接影响故障时的行为不同项目的要求不一样。自动转换开关是这段最需要小心的设备。它分两个大类一类是专用转换开关触头专门为切换设计切换快、可靠性高另一类是用两台断路器加机械联锁实现成本低但切换速度慢触头也不是为频繁切换设计的。数据中心的主进线切换应该用前者而且要选带旁路维护功能的型号这样转换开关本身检修时不用停负载。关于切换时间我想强调一个容易被误解的点自动转换开关的切换时间通常在几百毫秒到两秒之间这个时间对IT设备来说是致命的。它不是UPS不能用来保障IT负载。它的作用是在市电和柴发之间切换或者在两路市电之间做长时间切换切换期间负载由UPS和电池支撑。我见过有人把自动转换开关当成快速切换电源来保障服务器结果切换瞬间服务器全重启这个理解偏差必须纠正。注意双路市电切换、市电与柴发切换都属于秒级动作IT负载必须依赖UPS过渡任何指望转换开关本身保住服务器的方案都是错的。3.2 UPS与HVDC的选型分歧UPS这块的争论一直没停过。工频机和高频机的差别本质上是变压器在不在机器内部。工频机内置输出变压器抗冲击能力强、对负载的适应性好缺点是体积大、重量大、效率略低。高频机省掉了工频变压器体积小、效率高、输入功率因数好但对负载的适应性和抗冲击能力相对弱一些选型时要确认负载类型。模块化UPS这几年基本成了主流选择。它的好处很直观按需配置功率模块初期投资低模块故障时其余模块继续工作更换模块不需要停机扩容时加模块就行。但它也有代价机架本身的容量是固定的模块数量有上限而且模块多了之后监控和均流管理更复杂。我个人的经验是如果负载增长曲线明确、机房空间紧张模块化值得优先考虑如果负载已经稳定、单机容量需求大传统大容量UPS可能更省心。效率指标要分开看。双变换模式下的效率通常在94%到96%之间ECO模式可以到98%以上但ECO模式下市电直接供电切换过程中仍然有毫秒级的扰动对极其敏感的设备不一定合适。我的做法是核心业务维持双变换非核心或者有冗余的负载可以开ECO但一定要实测切换波形确认设备能扛住。HVDC高压直流是另一个方向240V或336V直流输出直接给服务器供电。它的优势是效率高、结构简单、电池可以直接挂在直流母线上省掉逆变环节、可靠性理论上更好。但它的落地受限于服务器电源必须配直流输入的电源模块生态上不如交流UPS成熟。国内一些大型互联网机房用得多普通企业机房如果要上得先确认服务器厂商能不能供直流电源否则方案直接卡死。我的判断是新建大型自用机房、服务器采购可控的场景可以认真评估HVDC改造项目、设备品牌杂乱的场景老实用交流UPS。3.3 蓄电池与柴油发电机电池是UPS系统里寿命最短、最容易被忽视的部分。铅酸电池便宜、技术成熟但占地大、重量大、对温度敏感寿命通常三到五年。锂电池占地小、重量轻、循环寿命长、支持大电流放电但成本高而且需要配套的电池管理系统和消防措施。选哪种要看机房条件如果电池间面积紧张、楼板承重有限锂电池的优势就体现出来了。电池容量计算不能只看后备多少分钟这个数字。电池的实际输出能力跟放电倍率强相关放电越快可用容量越少。所以计算的时候要用电池厂家提供的恒功率放电表而不是简单用安时数乘电压。这一点后面第四节的实操部分我会写具体的计算方法。电池的温度管理也很关键。铅酸电池的额定容量是在25度环境下标定的环境温度每升高10度寿命大约减半。很多机房把电池放在没有独立空调的角落里夏天温度轻松超过35度电池两三年就不行了。我建议电池间单独做温控如果预算不允许至少要有强排风和温度监控把温度控制在30度以内。柴油发电机是最后一道防线。容量选型通常按UPS的总容量乘以1.2到1.5的系数因为UPS在带载启动时有一定的冲击而且柴发在突加负载时的动态特性会影响输出电压和频率。柴发的加载策略一般是分步加载先带一部分负载稳定后再逐步增加避免一次加载过大导致频率跌落甚至停机。油箱容量通常按满载运行8到12小时配置有条件的话配储油罐保证长时间断电时的续航。柴发的日常维护比UPS更重要因为它是长期闲置的设备。定期空载试机、带载测试、油路检查、蓄电池检查一样都不能少。我见过不止一次市电真断了、柴发启动失败的情况原因都是长期没做带载测试燃油系统有空气或者启动电池亏电。这类问题在测试中暴露出来是好事在真故障时暴露就是事故。3.4 末端配电列头柜、母线槽与智能PDU末端配电是把电送到机柜的最后一段也是最容易乱的一段。传统做法是列头柜加线缆每排机柜配一个列头柜从列头柜拉电缆到每个机柜的PDU。这种方式灵活、成本可控缺点是线缆多、改动麻烦、占空间。母线槽是另一种做法沿着机柜排上方或者下方铺设机柜通过插接箱取电扩容和调整位置特别方便缺点是初期投资高、载流量有限、插接点需要定期检查。智能PDU这几年普及得很快它最大的价值不是远程开关插座而是计量。机柜级、插座级的电流、功率、电量数据能让你清楚知道每个机柜实际用了多少电、三相是否平衡、峰值出现在什么时候。这些数据对容量规划极其重要。我做过一个项目前期按平均5kW每机柜规划上了智能PDU之后发现有的机柜实际跑到7kW以上有的只有2kW负载分布严重不均。如果不做机柜级计量这些问题根本看不见等到某个支路过载跳闸才发现就晚了。机柜的双路供电要特别注意来源。A路和B路必须来自两个不同的UPS系统或者至少两个不同的配电支路绝对不能从同一个列头柜的两路出线来接那样等于没有冗余。接线的时候要有明确标识我建议用不同颜色的线缆和标签区分A、B路运维换线的时候不容易搞错。还有一种情况是设备只有一个电源接口这种设备要么配静态转换开关要么就只能接在一路电源上接受这路电源故障时设备掉线的风险这个取舍要在设计阶段就跟业务方确认清楚。4. 一次完整的容量推演从负载表算到线径4.1 负载统计与需求系数容量计算的第一步是把负载统计清楚。IT负载是最核心的部分包括服务器、存储、网络设备。获取这个数据有几种方式新机房可以按规划的设备清单估算改造机房最好用智能PDU实测数据什么都没有的时候只能按机柜数量和预估功率密度来算。举个具体的例子。假设一个机房规划200个机柜规划功率密度平均5kW每机柜那IT负载的理论最大值是1000kW。但实际运行中不可能每个机柜都跑满所以要乘以一个同时系数。这个系数跟业务类型有关互联网业务波动大同时系数可能取0.8到0.9传统企业业务比较稳定可以取0.9到0.95。这里我取0.9得到实际IT负载900kW。除了IT负载还要加辅助负载。照明、监控、门禁这些占比很小可以忽略或者按经验值加个几kW。真正大头是制冷系统也就是空调和冷机。如果做整体配电设计制冷负载要单独算通常按PUE反推。假设设计PUE是1.3那制冷及其他非IT负载大约是IT负载的30%也就是270kW。这里有个设计习惯的差异有的方案把IT负载和制冷负载分开配电UPS只保障IT负载制冷由市电直接供电有的方案把制冷也纳入保障范围。前者成本低但市电中断时制冷会停机房温度会在几分钟内快速上升通常靠柴发启动后恢复制冷来衔接中间有个温度上升的窗口。后者成本高但连续性更好。这个选择取决于业务对温度的敏感程度和柴发的启动可靠性。我一般建议核心机房把制冷的关键部分纳入柴发保障但不一定要走UPS。4.2 UPS容量与电池后备时间计算拿到IT负载900kW之后开始算UPS容量。计算要考虑三个因素功率因数、负载率目标、冗余方式。现代服务器的电源模块基本都带功率因数校正功率因数可以按0.95到0.99来取保守一点取0.95。那么视在功率是900除以0.95约947kVA。UPS的最佳负载率通常在40%到60%之间太低效率差、投资浪费太高没有余量、风险大。取50%作为设计负载率那么需要的UPS容量是947除以0.5约1894kVA向上取整选2000kVA。如果做2N那就是两套2000kVA的系统每套都能独立带全部负载。如果做N1可以选三台800kVA加一台备用总容量3200kVA实际负载率约30%这个余量偏大了可以调整成两台1000kVA加一台备用或者三台模块化机架按需配模块。我用一段简短的Python把上面的逻辑固化下来方便反复试算不同参数def ups_sizing(it_load_kw, pf0.95, target_ratio0.5, model2N, unit_kva500): it_load_kw: IT负载有功功率 kW pf: 功率因数 target_ratio: 目标负载率 model: 冗余模型 2N / N1 unit_kva: 单机容量 kVA s_required it_load_kw / pf / target_ratio # 向上取整到单机容量的整数倍 import math units math.ceil(s_required / unit_kva) if model 2N: # 两套独立系统每套都能带全部负载 per_system units total units * 2 else: # N1负载分配在N台另加1台备用 n max(1, units - 1) per_system n 1 total n 1 actual_ratio (it_load_kw / pf) / (per_system * unit_kva) return { 所需视在功率_kVA: round(s_required, 1), 每套配置_台: per_system, 总台数_台: total, 实际负载率: round(actual_ratio, 3) } print(ups_sizing(900, 0.95, 0.5, 2N, 500))跑出来的结果是每套四台500kVA两套共八台每套实际负载率约47%。这个配置的余量比较合理负载增长到1000kW也还能扛住。电池后备时间的计算要更细致。市电中断到柴发稳定带载一般需要10到30秒考虑柴发启动失败需要重试的情况电池后备时间通常按10到15分钟设计。计算过程是先确定UPS在目标后备时间下的输出功率再除以逆变效率和电池放电系数得到电池需要提供的直流功率最后按电池的恒功率放电曲线选型。以上面的负载为例单套系统承担900kW负载按后备10分钟计算def battery_sizing(load_kw, backup_min, inv_eff0.94, dc_bus_v480): 简化估算实际选型必须查电池厂家的恒功率放电表 load_kw: 单套系统承担的负载 kW backup_min: 后备时间 分钟 inv_eff: 逆变效率 dc_bus_v: 直流母线电压 hours backup_min / 60 # 电池实际需要输出的能量考虑放电系数 0.55大电流放电时的修正 discharge_factor 0.55 energy_kwh load_kw * hours / inv_eff / discharge_factor # 换算成安时 ah energy_kwh * 1000 / dc_bus_v return { 电池需要能量_kWh: round(energy_kwh, 1), 母线电压_V: dc_bus_v, 估算安时_Ah: round(ah, 1) } print(battery_sizing(900, 10))算出来大约需要590Ah。按常见的400Ah电池配置就是两组400Ah实际可用容量有一定余量。要强调的是这个计算是简化估算真实的电池选型必须用厂家的恒功率放电表按单体的放电终止电压和放电时间查表再乘以温度修正系数和老化系数。铅酸电池的寿命末期容量会衰减到额定值的80%左右设计时最好按80%来选给老化留余量。4.3 线缆、母排与保护配合线缆选型要过三关载流量、电压降、短路热稳定。载流量是最基本的。铜芯电缆在空气中敷设环境温度35度的情况下参考载流量大致如下截面 mm²参考载流量 A单芯、空气中常见用途25约110小容量列头柜进线35约135支路配电50约165中等容量列头柜70约205列头柜进线95约245列头柜进线120约285主配电馈线185约375主配电馈线240约445大容量馈线多用于多拼这些数字只是量级参考实际必须查厂家样本和敷设方式修正系数。多根并联时要乘一个降容系数一般取0.85到0.9。穿管、桥架内敷设也会降容这些修正不做算出来的载流量是虚高的。电压降是第二个约束。从变压器到末端机柜总压降一般控制在5%以内末端支路自己控制在3%以内。电压降跟电流、线路长度、功率因数都有关系长距离馈线尤其要注意。我做设计时习惯在计算表里把每一段的压降单独列出来累加看总量超了就加大截面或者缩短路径。短路热稳定是第三关。发生短路时电缆要在保护动作的时间内承受住短路电流的热效应。这个校验需要知道短路电流的大小和保护的动作时间截面不够的话短路瞬间电缆绝缘就会受损。这一步很多人会跳过觉得载流量够就行实际上在短路容量大的系统里热稳定经常成为控制截面选型的因素。母排的选择同理除了载流量还要校验动稳定也就是短路时的电动力能不能让母排变形。保护配合是个细活。上下级断路器的整定要形成时间差和电流差保证故障时最近的保护先动作不要越级跳到上级。UPS输入输出侧的断路器整定还要考虑UPS的启动冲击和旁路切换整定得太灵敏会误跳。这块我建议做一份完整的保护配合表把每个断路器的额定电流、长延时、短延时、瞬动整定值都列出来调试的时候逐台核对。4.4 机柜选型与配电能力匹配机柜的选择跟配电能力是绑在一起的不能分开看。机柜的功率密度直接决定PDU的规格、支路的容量、甚至是否需要更换架构。普通业务机柜功率在3到5kW配两个单相16A的PDU或者一个三相16A的PDU就够了。到了5到8kW建议用三相32A的PDU三相配电天然比单相更容易平衡。8到15kW的机柜PDU要上到三相32A甚至更高同时要配垂直安装的0U PDU因为水平安装的1U PDU在这种功率下散热和线缆管理都很难受。超过15kW基本就要考虑液冷配套或者用母线槽直接对机柜供电把PDU简化为取电单元。机柜本身的规格也要跟功率匹配。高功率机柜需要更好的前后门开孔率一般要78%以上不然冷风进不去、热风出不来。深度方面普通机柜800到1000毫米够用但装GPU服务器的话深度普遍要1100毫米以上有些机型甚至需要1200毫米。承重也要注意满配的GPU机柜重量可能超过1000公斤静态承重要留足余量地板或者支架的承重能力要单独校核。还有一个容易忽略的点服务器上电瞬间的冲击电流。服务器的电源模块在上电瞬间会有较大的浪涌电流多台设备同时上电时这个浪涌可能叠加到额定电流的好几倍导致支路断路器误跳。解决方法有两种一是采用分步上电让设备错开启动二是选择带延时脱扣特性的断路器能扛住短暂的冲击。我实际调试时更倾向于分步上电配合带计量的PDU上电过程中盯着电流曲线看哪一路冲高了就停下来分批发。5. 上电调试现场并机、切换与带载测试5.1 上电前的检查清单上电是整个工程里最紧张的时刻一旦有短路或者接线错误可能就是设备损坏甚至安全事故。我整理的检查清单大致包括这几项。接线核对是第一项也是最重要的。所有一二次接线要跟图纸逐条核对尤其是相序、极性、互感器变比这些。相序错了三相设备会反转或者异常发热互感器变比错了计量和保护的数值全是错的。核对接线的时候要两个人交叉检查一个人看图纸一个人看实物比一个人自己看靠谱得多。绝缘测试是第二项。主回路、控制回路分别测绝缘电阻记录数值。绝缘不合格绝对不能上电必须查明原因。测试完之后要记得放电尤其是长电缆和电容器。开关状态确认是第三项。所有断路器、隔离开关的分合状态要在上电前确认一遍避免带负载合闸或者带电挂地线。接地开关要全部拉开接地线要全部拆除这个顺序和状态最好做成表格一项项打勾。保护定值核对是第四项。前面说的保护配合表这时候要逐台核对断路器的整定值是否跟设计一致。很多设备的出厂定值跟设计值不一样不核对就上电等于保护形同虚设。电池组检查是第五项。电池的连接条力矩、极性、开路电压、内阻都要测一遍。电池是串联的一根连接条松动就可能在大电流放电时打火甚至烧毁。力矩要用扭力扳手按厂家要求拧紧不能凭手感。所有检查完成之后先空载上电观察电压、相序、指示灯、监控数据一切正常再逐级带载。带载要从小到大边带边测温度、电流、电压发现异常立刻停下来。5.2 并机与切换测试怎么做扎实并机调试是UPS系统里技术含量最高的环节。多台UPS并机运行需要确保各台的输出电压、相位、频率严格同步负载均分。调试步骤一般是从单机开机、参数设置、同步校准到并机运行、均流测试、带载测试。均流测试要重点关注不平衡度。理想情况下各台UPS的输出电流应该基本相等实际允许有5%左右的偏差。偏差过大可能是同步参数、输出阻抗或者检测电路的问题需要厂家配合调整。我遇到过并机后一台机器长期偏载的情况原因是均流线接触不良这种问题在轻载时不明显满载时才暴露所以带载测试一定要做到接近额定负载。切换测试分几种。市电切换测试是模拟一路市电失电看系统能否正常切换到另一路IT负载是否受影响。这个测试要配合负载端的监测记录切换瞬间的电压波形。UPS切换测试是模拟UPS故障看能否切到旁路以及切回时是否平稳。电池放电测试是断开市电让电池带载运行到设定时间观察电压下降曲线和报警情况。柴发带载测试是启动柴发逐步加载到设计容量观察频率、电压稳定性和加载能力。我的经验是每次测试都要有完整的记录包括测试时间、测试项目、测试前的状态、测试过程和结果、发现的问题和后续处理。这些记录不只是为了交差更重要的是作为基线以后再次测试时能对比发现设备性能的变化趋势。电池的放电曲线尤其重要前后对比能提前发现电池容量衰减。6. 常见故障排查与避坑实录6.1 问题速查表我把这些年遇到和听到的典型问题整理成表格方便快速对照排查。现象可能原因排查方向处理建议某相电流明显高于其他相单相负载分配不均用钳形表逐路测电流看负载分布重新分配单相负载把大功率单相设备挪到轻载相电池后备时间明显缩短电池老化、环境温度高、长期浮充电压偏差测单体电压和内阻查电池间温度更换落后单体改善电池间温度校准充电电压UPS频繁转旁路负载冲击、逆变器过载、内部故障查负载电流波形看是否有大电流冲击分散上电时序检查负载是否超过容量联系厂家检测柴发启动后频率不稳加载过快、燃油供油不足、调速器问题观察加载过程检查油路改为分步加载检查燃油滤清器和油路密封支路断路器误跳浪涌电流、断路器定值偏小、接线松动查跳闸时的负载状态和电流记录调整上电时序核对断路器曲线紧固接线机柜PDU报过载实际负载超出规划、负载分布不均看PDU计量数据迁移部分设备调整机柜分配变压器温升异常负载率过高、散热不良、谐波损耗测负载率和温升检查通风降低负载率改善通风评估谐波治理表格里每一条都是真实会遇到的问题。我特别想说的是电池后备时间缩短这一项它往往不是突然发生的而是缓慢衰减日常巡检不做放电测试就发现不了。6.2 手册里不会写的几条经验第一条永远不要相信图纸上是对的。现场施工和图纸有出入是常态接线错、标签错、设备型号不符什么情况都有。上电前一定要实地核对图纸只是参考。第二条给电池间装个温度记录仪成本很低作用很大。电池衰减跟温度的关系太密切了有了长期温度数据你就能解释为什么某组电池寿命特别短也能量化改善措施的效果。第三条智能PDU的数据要定期看不要装了不用。很多次容量告警都是通过PDU的趋势数据提前发现的比如某个机柜的功率在过去三个月持续上升那就要提前规划迁移或者扩容而不是等跳闸。第四条柴发的定期带载测试必须真带载不能只空载试机。空载运行只能验证启动系统验证不了带载能力和油路在高负荷下的表现。我建议每季度做一次不低于50%额定容量的带载测试有条件的话每年做一次满载测试。第五条所有关键操作都要有两人在场一个人操作一个人监护。配电操作涉及高压和带电作业风险不低单人操作的容错空间太小。第六条维护记录要写清楚为什么不只是做了什么。比如更换了某个断路器要记录是因为什么现象、经过什么排查、判断是什么原因。这些信息在下次遇到类似问题时价值极高。7. 高密机柜、液冷与负载调度带来的新变化7.1 液冷机柜对配电提出的新要求这两年高密算力的需求把机柜功率密度推得很快风冷机柜做到15kW以上就已经很吃力再往上基本都要上液冷。冷板式液冷目前是落地最多的方案机柜功率可以做到30到80kW浸没式更高单柜上百千瓦也不稀奇。液冷对配电的影响是连锁的。首先是机柜侧功率密度上去了传统的列头柜加电缆的方案在很多场景下不够用了母线槽直供或者一体化配电单元成为更常见的选择。其次是冷却分配单元的供电它相当于液冷系统的心脏一旦失电冷却液循环停止芯片温度会在很短时间内飙升。所以冷却分配单元必须纳入UPS保障范围而且自身要有冗余通常是N1配置。还有几个细节容易被漏掉。液冷系统的漏液检测要跟配电联动检测到漏液应该立即告警并在必要时切断对应机柜的供电防止液体接触带电部件。二次侧的管路材质、水质管理、快接头的可靠性都会影响长期运行的稳定性。配电和液冷这两套系统在设计阶段就要一起考虑不能先做完配电再补液冷那样接口和空间都会很别扭。我参加过几次液冷相关的技术交流一个共同的感受是液冷不是简单的把风冷换成水冷它改变了机房的功率分布、热管理逻辑、运维流程配电作为配套设施必须同步演进。比如功率密度提高后单位面积的配电容量需求成倍增长低压柜的馈线数量、母排容量、电缆通道都要重新算。7.2 可调度与不可调度任务如何影响配电分区云计算和容器化普及之后负载开始有了可调度和不可调度的区分。不可调度任务一般指那些不能随意中断、不能随意迁移的业务比如核心数据库、交易系统、存储集群的控制面。可调度任务指那些可以中断、可以迁移、可以排队等待的业务比如离线训练、批量计算、视频转码、日志处理。这个区分对配电设计有很实际的影响而且很多人没意识到这一点。传统的做法是所有负载一视同仁都走双路UPS都按最高等级保障。但实际上可调度任务完全没必要花这么多钱。它们可以在电力紧张的时候主动让出资源甚至在市电切换时接受短暂中断任务重新排队就好。落到配电架构上可以这样分区不可调度负载走标准的双路UPSA、B两路来自独立系统保证任何一路故障都不影响业务。可调度负载走一条保障等级略低的支路可以是单路UPS加市电或者干脆市电加自动转换开关配合机柜级计量和监控。当市电波动或者柴发带载时监控系统感知到电力紧张通知调度系统把可调度任务逐步迁移或者暂停释放出电力给不可调度负载。这个思路的价值在于它把配电容量和IT调度打通了让电力资源可以被动态管理而不是永远按峰值配置。实现上需要几个条件机柜级的功率计量要准调度系统要能接收电力告警并做出响应业务侧要能接受任务中断和重新排队。技术上不复杂难的是业务侧的配合和流程上的约定。我个人的判断是这种电力感知的调度会越来越普遍尤其是在电力成本高、容量受限的园区。配电设计如果一开始就把可调度和不可调度负载分开走线、分开计量后续做这类优化会容易得多临时改造的代价则很大。7.3 个人和小型数据中心怎么搭一套靠谱配电最后说说个人和小型机房的配电。这类场景预算有限、空间有限但基本的安全和可靠性要求不能省。供电方式一般是单相220V如果设备多、功率大可以申请三相进线。总进线的容量要根据所有设备的总功率算留出30%以上的余量。服务器、存储、网络设备加起来算IT负载空调、除湿这些单独算空调建议走独立回路不要跟IT设备混在一起。UPS的选择个人场景一般1到3kVA就够了注意要看输出是纯正弦波还是模拟正弦波带主动式PFC电源的服务器必须用纯正弦波输出的UPS模拟正弦波的可能会引起电源异响甚至损坏。后备时间按15到30分钟配置主要目的是撑过短时波动和给正常关机留时间。线径和回路要算清楚。常见的参考是16A回路用2.5平方毫米铜线25A回路用4平方毫米32A回路用6平方毫米。插座用工业级的普通家用插座长期带大电流容易发热老化。接地一定要做机柜、设备外壳、防静电地板都要可靠接地接地电阻尽量做到最低。机柜选择上12U到22U的小机柜比较常见注意深度要够很多服务器深度超过700毫米浅机柜装不进去或者后面线缆挤成一团。散热要规划好小机房的常见错误是把机柜塞在封闭的储物间里热量排不出去设备温度轻松超标。至少要有进风口和排风口有条件的话装个温控风扇或者小型空调。监控方面一个带计量的PDU加一个温湿度传感器就能覆盖大部分的日常监控需求。电流异常、温度过高能及时告警比事后发现问题强得多。另外记得给服务器配置来电自启动市电恢复后设备能自动开机不用人工一台台去按电源键。这些东西看起来琐碎但真正出问题的时候往往就是这些细节没做好。我在自己那台小机柜上踩过的坑包括UPS输出接了带开关的插排导致意外断电、机柜后面线缆太乱影响散热、接地线接在了水管上这是绝对错误的做法。这些经验写出来希望后来的人能少走点弯路。设备选型这件事我这些年最大的体会是不要追求单一指标的极致要看整个链路的匹配。一台效率特别高的UPS配一条截面不足的电缆整体可靠性还是上不去一套完整的2N架构配一个负载分配严重不均的末端一样会在某个支路上跳闸。供配电是一套系统工程从进线到芯片每一环都要经得起推敲任何一环的短板都会成为整条链路的瓶颈。实际做项目的时候我习惯在图纸定稿前把整条链路从头到尾走一遍想象电流是怎么流的、故障时会发生什么、维护时怎么隔离走完这一遍很多隐藏的问题自己就冒出来了。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表