拓冰建站拓冰建站
首页 / 资讯中心 / 正文

服务器硬件巡检只能靠人跑机房吗?DCMP 带外监控实践

机房设备一多硬件巡检就成了个绕不过去的活。每周或者每月去机房走一圈看指示灯、听风扇、抄面板回来再更新台账忙半天还是会漏。而且有些故障你站在机器面前也看不出来。双电源坏了一路另一路顶着机器照常跑业务无感指示灯就算有提示一排机柜几十台设备靠肉眼一台台看也很容易漏。SSD 磨损度快到头了指示灯不会因为盘还剩 5% 寿命就变红。这些信息设备本身其实一直都有在主板上那颗 BMC 芯片里走带外通道就能取出来。下面说说我们智安维DCMP是怎么做的。一、代替机房巡检7×24 带外采集有告警一分钟内通知到。每天一封巡检报告直接发到邮箱不用登录系统打开邮件就知道昨天机房什么情况。报告里写清楚三件事今天有没有问题、哪些要立刻处理、哪些可以观察。不是丢一堆传感器读数让人自己判断。告警这块做了收敛和定级。BMC 上报的东西挺杂的一个故障可能触发好几条不做处理的话值班的人两天就麻木了。我们把同一个部件的多条事件合并成一条标明严重程度能直接拿去派单。严重告警会定位到具体设备和机柜位置比如哪个机房、哪一排、哪个机柜、第几个 U 位不用再去翻台账找机器在哪。二、自动生成设备台账设备接进来的同时台账就长出来了不用人工填。厂商、型号、序列号、CPU 内存硬盘的部件级配置、所在机柜和 U 位、维保到期时间都是自动采的。换一根内存、插一块硬盘系统会自动更新并留痕能看到什么时候换的、换的什么型号。这块省的人力其实比告警还多。以前靠 Excel 维护台账永远是过期的人一走就断档现在是账实同源的。三、机房可视化管理U 位用了多少还剩多少、电力负载多少、哪个机柜还能上架、PDU 使用率多少一张报表说完。季度上报的容量材料能直接生成不用每次重新梳理而且数据是从设备实采出来的跟实际对得上。数据是怎么采到的这部分展开说一下因为很多人对带外能拿到什么没概念。服务器主板上有一颗独立的管理芯片 BMC戴尔叫 iDRACHP 叫 iLO华为叫 iBMC联想那边是 XCC。它有独立的处理器、独立网口、独立供电只要机器插着电哪怕没开机、系统崩了都能通过网络访问到它。这就是带外走的是业务网络之外的一条独立通道。这也是它和装 agent 的根本区别agent 跑在操作系统里机器一宕它第一个失联而带外在机器关机、系统起不来的时候照样能采。DCMP 走两个协议IPMI 2.0老标准基本所有服务器都支持。能拿到厂商型号序列号这类资产信息以及温度、功率、风扇转速、电压这些传感器读数。局限是告警比较简陋只知道有个告警具体哪个部件什么原因说不清楚部件清单也拿不全。RedfishDMTF 后来推的标准走 HTTPS 加 JSON。能拿到的细得多每根内存条在哪个插槽、什么型号什么容量、错误计数多少硬盘的健康状态和 SSD 剩余寿命百分比RAID 卡和逻辑卷状态电源模块的具体输入输出。告警是部件级的能直接定位到是哪一根内存、哪一块盘出的问题这种告警才是能直接开工单的。另外 SEL 系统事件日志也在这条通道里机器上次为什么宕的一般都写在里面。老机器不一定支持 Redfish所以实际是两个协议混着用能走 Redfish 的走 Redfish不行的用 IPMI 兜底。支持哪些设备服务器这块戴尔、HP、浪潮、华为、联想这些主流厂商都在跑信创服务器和国产算力设备也做了适配。存储和网络设备走 SNMP 纳管交换机、路由器、防火墙、存储阵列都能接进来采基础运行状态和台账信息。深度上比不了服务器那一层但机房管理本来就不只有服务器设备清单、机柜里放了什么、容量还剩多少得把这些都算进去才是完整的一张视图。社区版免费100 台纳管设备以内免费用功能包括巡检报告、设备台账、容量统计。一台虚机就能部署官网 www.dcmp.cn可以直接下载安装包。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门