预测性维护的目标不是“准确预测每一次故障”,而是把非计划停机变成可安排的计划停机。能做到这一点的项目,往往不是算法最先进的,而是数据质量最好、故障样本梳理最清楚的。

一、先确定要监测什么故障
旋转设备的典型故障与信号特征有明确的对应关系,选对测点比选对算法重要得多:
| 故障类型 | 主要信号 | 特征 |
|---|---|---|
| 转子不平衡 | 振动 | 转频处幅值升高,径向明显 |
| 对中不良 | 振动 | 二倍频分量突出,轴向偏大 |
| 轴承磨损 | 振动 + 温度 | 高频包络能量上升,温度逐步抬升 |
| 润滑不良 | 温度 | 温升速率异常,不稳定波动 |
| 电气故障 | 电流 + 振动 | 电流谐波异常,转频边带出现 |
实际项目中,建议先从轴承与不平衡这两类入手:它们的信号特征清楚、发生率最高、后果也较严重,最容易看到效果。
二、数据采集的三个关键参数
采集环节没做好,后面再好的模型也救不回来。
采样率。要做轴承高频包络分析,采样率需要足够高(通常建议不低于20kHz);只做趋势监测则几kHz足够。采样率选低了,高频故障特征直接丢失,事后无法弥补。
采样时机与工况关联。振动幅值受转速和负载影响极大。如果不记录当时的转速与负载,不同工况的数据混在一起,趋势会完全失真。建议采集时同步记录工况参数,分析时按工况分段。
测点位置与一致性。传感器的安装位置、方向、固定方式必须保持一致。换一个位置重装,历史趋势就断了,等于重新积累数据。
三、算法路线的现实选择
真实项目中,故障样本非常稀缺——可能三年才出现几次轴承损坏。因此一开始就上深度学习不是明智选择。更可行的路线是:
- 第一阶段:阈值与趋势告警。用振动有效值(RMS)和温度做多级阈值,配合变化率判断。这个阶段就能覆盖相当一部分早期异常。
- 第二阶段:特征 + 异常检测。提取时频域特征,用无监督方法(如孤立森林、自编码器)找出偏离正常模式的数据。不需要故障样本。
- 第三阶段:有监督模型。积累到一定数量的标注故障样本后,再训练分类模型区分故障类型。
跳过前两个阶段直接做第三阶段,是这类项目最常见的失败原因。
四、把预警接入运维流程
预测性维护失败的主要原因不是算法不准,而是告警发出后没人处理。要闭环,需要:
- 告警分级:区分“关注”“计划检修”“立即停机”三档,避免告警疲劳。
- 给出处置建议:不只是报“三号轴承异常”,还要说明建议的检修窗口和备件。
- 结果反馈:检修后回填实际原因,这些数据是模型迭代的唯一依据。
五、如何衡量项目价值
建议一开始就建立基线:当前非计划停机次数与平均时长、关键备件的库存周转、维修人力投入。上线后再对比这三项指标的变化,算出真实收益。
预测性维护是长期积累的过程,第一年的目标应该是“把数据基础打好、把流程跑通”,而不是追求告警准确率。数据积累到两年以上,模型效果才会真正显现。
