用数据预测液体滤芯的剩余寿命

仅凭压力和流量传感器数据,能否预测液体过滤器在堵塞前的剩余寿命?本文解读一篇将压差转换为0~1健康指数,并用三种LSTM结构进行预测的论文。

本文译自韩文原文。 韩文原文

在航空、发电厂等多个行业中,滤芯用于过滤流体中的污染物。流体流过时,污染物会不断积聚在滤芯上。时间一长,滤芯就会堵塞,进而导致机器性能下降和故障。

如果按固定周期更换滤芯,可能出现两种损失:要么丢弃了仍可使用的滤芯,要么漏掉了在更换周期到来之前就已堵塞的滤芯。现场管理人员需要的是一个数字,告诉他们”这个滤芯现在堵到了什么程度,今后还能再用多久”。

那么,仅凭记录滤芯前后压力和流量的传感器数据,能否诊断滤芯状态,并提前计算出距离堵塞还剩多少时间?

本文来读一篇回答了这个问题的论文。

  • 标题:Data-driven health condition and RUL prognosis for liquid filtration systems
  • 期刊:Journal of Mechanical Science and Technology
  • 年份:2021
  • DOI:10.1007/s12206-021-0323-8

论文提出了一种适用于液体过滤系统的数据驱动预测(预后)方法。首先定义一个表示滤芯健康状态的指数,然后用循环神经网络系列模型预测该指数从明显开始下降的点到寿命终止点之间的取值,由此得到剩余寿命。本文用到的核心术语如下。

  • 剩余使用寿命(Remaining Useful Life,RUL):从测量时刻起,到机器被判定为故障的时刻之间剩余的时间。
  • 基于状态的维护(Condition-Based Maintenance,CBM):利用持续监测或检查收集的数据评估系统状态,并在预测的故障发生之前确定所需维护的方式。
  • 故障预测与健康管理(Prognostics and Health Management,PHM):通过对机器状态进行量化评估来提高可靠性、降低维护成本的工程领域。它是 CBM 中最常用的方法。
  • 健康指数(Health Index,HI):用 0 到 1 之间的数值表示整个系统健康状态的定量指标。
  • 压差(pressure drop):滤芯上游压力与下游压力之差。
  • 退化点(degradation point):滤芯性能明显开始下降的点。论文认为,要计算 RUL,必须先找到这个点。
  • 寿命终止点(End of Life,EOL):预测的 HI 达到 0 或收敛于 0 的点。

动机:需要提前用人人都能读懂的数字掌握滤芯堵塞情况

为什么滤芯寿命预测很重要

论文给出的理由如下。

  • 滤芯是支撑多种系统顺畅运转的部件,因此是重要的维护对象。
  • 污染物堵塞滤芯,会造成机器性能下降和故障。因此,在堵塞之前更换老化部件的预防性维护,对设备管理人员很重要。
  • 要高效地开展预防性维护,就应采用 CBM:通过实时监测评估滤芯的当前状态并预测 RUL。
  • 液体滤芯用于保持油品纯度、解决水资源短缺等问题。

论文把 PHM 分为检测、诊断、评估和预测四个领域。检测是在不知道原因的情况下发现故障,诊断是查明故障的原因和类型。评估是根据近期运行情况判断机器的健康状态,预测则是预判未来的健康状态和 RUL。这篇论文同时处理用 HI 评估当前状态和预测 RUL 两件事。

现有研究没有涉及的部分

论文把预测模型分为物理模型(physics-based model)和数据驱动模型(data-driven model)。物理模型利用设备可能出现的故障知识,用数学公式描述产品状态。它的故障预测比其他模型更准确,因此适合发电厂、飞机等安全至上的行业。但它难以与实时数据对接,而且每种产品都需要专业知识和大量资源,所以很难通用。

数据驱动模型利用收集到的数据预测设备故障。随着传感器技术的发展,已经可以从使用中的产品实时收集数据,这类模型的 RUL 估计精度也在提高。在滤芯领域,有 Skaf 等人用基于状态的预测方法估计滤芯 RUL 的案例。

论文指出的空白有三点。

  • 液体滤芯的研究比其他类型滤芯的研究少。
  • 现有的液体滤芯研究大多采用物理模型。物理模型实现成本高,在复杂系统中很难精确建立。
  • 现有的预测研究是直接预测与系统相关性高的指标本身。这种方式需要了解多个指标,非专业人员很难理解系统的当前状态。

因此,论文认为需要开展用 HI 评估状态并预测故障的研究。

方法:把压差转换成 0~1 的指数,用 LSTM 预测退化之后的区间

论文分三节说明流程:数据预处理、HI 定义与健康阶段划分、通过 HI 预测得出 RUL。本文把第二节单独拆出来,作为 HI 定义和健康阶段划分,分四个步骤说明。第 1 步去除噪声数据并减小压差的大幅波动。第 2 步定义 HI,第 3 步用 K-均值聚类(K-means clustering)划分健康阶段。第 4 步用三种长短期记忆(Long Short-Term Memory,LSTM)模型预测 HI 并得出 RUL,再用指标验证预测模型。

图 1. 将传感器记录转换为 MAPD 和 HI,再用 LSTM 预测退化点之后的 HI 以得出 RUL 的四步流程。

案例与数据

分析数据是 PHMe20 Data Challenge 提供的液体滤芯堵塞数据。实验装置由以下部分组成。

  • 泵和液体储罐:泵把一个储罐中的液体输送到另一个储罐。
  • 阻尼器:压力升高时防止管道膨胀。
  • 滤芯、压力和流量传感器:监测滤芯前后的流量和压力。
  • 数据采集装置:与计算机相连,记录测量值。

输送的悬浮液是 PEEK 颗粒与水的混合物。PEEK 颗粒的密度为 1.3 g/cm3,接近水,吸水率为 0.1 %/24 h,非常低。吸水率低,颗粒就不会在水中膨胀;密度接近水,颗粒就能在水中悬浮更久。

数据包含滤芯从开始使用到故障的记录。按颗粒尺寸和固体含量比例的组合分成 6 组,每组做了 4 次实验,所以数据文件共有 24 个。每个文件每 0.1 秒记录一次流量(ml/m)、上游压力(PSI)和下游压力(PSI)。

各组的构成是两个颗粒尺寸区间与三个固体含量比例水平的组合。颗粒尺寸为 45-53 micron 和 63-75 micron,固体含量比例为 0.4 %、0.425 % 和 0.45 %。第 13 组使用小颗粒,第 46 组使用大颗粒。

故障判定标准遵循 Data Challenge 的标准。压差大于 20 时,认为滤芯已堵塞。每组前 3 个样本用于训练,最后 1 个样本用于测试。以第 1 组为例,01-03 用于训练,04 用于测试。

第 1 步:去除噪声与移动平均

  • 输入:各样本的流量、上游压力、下游压力(0.1 秒间隔)
  • 处理:删除异常区间、计算压差、应用简单移动平均
  • 输出:移动平均压差(Moving Averaged Pressure Drop,MAPD)时间序列

处理顺序如下。

  1. 删除启动后流量异常偏小的起始部分。论文把这一区间视为系统进入完全运行之前所需的时间,判定为噪声数据。
  2. 删除压差在 20 以上的区间。这一区间是滤芯故障之后仍在持续记录的数据,分析中不需要。
  3. 用上游压力减去下游压力,得到压差。
  4. 对压差应用简单移动平均,生成 MAPD。

需要移动平均,是因为 0.1 秒间隔的测量值波动非常大。如果保留这些波动,就可能把相近时刻误读为滤芯状态发生了急剧变化。论文为了提高预测的稳定性和精度而减小了波动。

MAPD(t) 是从时刻 t-k 到 t 共 k+1 个区间的压差平均值。研究者经过多次实验把 k 定为 6,即对 7 个区间求平均。由于测量间隔为 0.1 秒,一个平均值汇集的是 7×0.1=0.7 秒内的压差。MAPD 为 0 表示上游和下游压力相同,滤芯状态最好。MAPD 为 20 表示滤芯故障。

第 2 步:定义健康指数

  • 输入:MAPD 时间序列
  • 处理:除以故障标准 20,转换到 0~1 范围
  • 输出:各时刻的 HI

检查滤芯性能下降时,通常使用流体通过滤芯前后的压力差。因此,论文把 MAPD 转换成 0 到 1 之间的值,构造出 HI。公式为 HI(t) = 1 − MAPD(t)/20。

HI 为 1 表示最佳状态,HI 达到 0 或收敛于 0 的时刻就是 EOL。这样转换之后,不了解滤芯故障标准的非专业人员也能确认滤芯状态。

举个计算例子。MAPD 为 0 时,HI = 1 − 0/20 = 1;MAPD 为 20 时,HI = 1 − 20/20 = 0。反过来,也可以由 HI 值反推 MAPD。第 3 步中将出现的第 1 组阈值 HI 0.929286,对应的 MAPD 为 (1 − 0.929286)×20 = 1.41428 PSI。

第 3 步:用 K-均值聚类划分健康阶段

  • 输入:各样本的 HI 时间序列
  • 处理:用肘部法确定聚类数,并执行 K-均值聚类
  • 输出:3 个健康阶段(正常、过渡、异常)和退化点的 HI(阈值)

系统刚开始运行时,HI 变化很小。在性能尚未下降的状态下,很难准确估计 RUL。实际上,大部分 HI 都集中在正常阶段或过渡阶段。因此论文先划分健康阶段,再找出滤芯不能正常工作的退化点。

处理顺序如下。

  1. 让聚类数 K 从 1 开始增加,同时计算误差平方和(Sum of Squared Error,SSE)。SSE 由聚类中心与属于该聚类的数据之间的距离计算得出。
  2. 找到 SSE 先快速下降、之后几乎不再变化的点,也就是肘部点。该点对应的 K 就是最优聚类数。
  3. 用确定的 K 执行 K-均值聚类。K-均值聚类是生成指定数量的聚类,并把每个数据分配给最近聚类的方法。
  4. 把过渡阶段与异常阶段的边界定为退化点,并把该点的 HI 设为阈值。

K-均值聚类是 PHM 中划分健康阶段时常用的方法。有把轴承的健康阶段分成 4 个聚类的研究,也有划分风速计健康阶段的研究。

在本案例中,K 增加时 SSE 的变化率直到 K 为 3 时分别是 74.9 % 和 13.8 %。此后变化率一直低于 5 %。因此 K=3 成为肘部点。所有实验数据的肘部点都是 3,所以把聚类数统一为 3。健康阶段分为正常(healthy)、过渡(transitional)和异常(unhealthy)三个阶段。

各组的阈值因颗粒尺寸而异。45-53 micron 的组(第 13 组)分别为 0.929286、0.928482、0.925179。63-75 micron 的组(第 46 组)分别为 0.852947、0.850569、0.847221。把第 6 组的阈值换算回 MAPD,为 (1 − 0.847221)×20 = 3.05558 PSI。

第 4 步:用 LSTM 预测 HI 并计算 RUL

  • 输入:前 30 个时刻的 HI 序列
  • 处理:用 LSTM 预测下一时刻的 HI,并把预测值重新放入输入中反复进行
  • 输出:预测 HI 曲线、预测 EOL、RUL、4 个性能指标

LSTM 源自常用于时间序列预测的循环神经网络(Recurrent Neural Network,RNN)。RNN 在很长时间之后再使用前面的信息时,学习能力会大幅下降。LSTM 通过增加细胞状态(cell state)来弥补这一问题。细胞内的层和运算有选择地接收输入信息,因此即使在长序列中也能保持或修改信息。

处理顺序如下。

  1. 输入是包含当前时刻 t 在内的前 30 个时刻的 HI,即 [HI(t−29), …, HI(t)]。输出是下一时刻的 HI(t+1)。
  2. 如果输入序列的所有值都低于阈值,就判断滤芯已进入异常阶段,并开始预测。
  3. 把最后一次预测结果重新放入输入。下一个输入是 [HI(t−28), …, HI(t), HI(t+1)],输出是 HI(t+2)。
  4. 把预测 HI 达到 0 的时刻视为 EOL,用它与预测起始时刻之差求出 RUL。

RUL 公式为 RUL(t_n) = t_EOL − t_n。t_EOL 是 EOL 时刻,t_n 是测量时刻。从异常阶段开始预测,是因为滤芯正常工作时很难预测 RUL。

预测性能用四个指标评估。

  • 均方根误差(Root Mean Square Error,RMSE):预测误差的标准差。先对实际值与预测值之差求平方并取平均,再开平方根。
  • 归一化 RMSE(normalized RMSE,nRMSE):RMSE 除以实际值平均值所得的值。它使不同模型之间的单位一致,便于比较。
  • 平均绝对误差(Mean Absolute Error,MAE):预测值与实际值之差的绝对值的平均值。对所有差值赋予相同权重。
  • 平均反正切绝对百分比误差(Mean Arctangent Absolute Percentage Error,MAAPE):对误差相对于实际值的比例取反正切后再求平均。

采用 MAAPE 是有原因的。常用的平均绝对百分比误差(Mean Absolute Percentage Error,MAPE)在实际值为 0 时无法计算。实际值小于 1 时,会得到接近无穷大的值。本研究中 HI 的实际值都小于 1,所以采用了 MAAPE。

变体与场景:三种 LSTM 结构与超参数

论文把 LSTM 分成三种结构进行比较。

  • 基础(vanilla)LSTM:由单层构成的基本 LSTM
  • 堆叠(stacked)LSTM:由多层堆叠而成的 LSTM
  • 双向(bidirectional)LSTM:同时沿正向和反向学习的 LSTM

这三种结构在 PHM 的故障预测中都很常用。论文介绍了两个前人研究案例:用双向 LSTM 预测飞机推进系统 RUL 的研究,以及用堆叠 LSTM 预测燃料电池 RUL 的研究。

训练设置按组和模型进行了调整。激活函数为 Elu,批大小为 1,优化方法为 Adam。研究者通过网格搜索(grid search)确定超参数。网格搜索是先确定超参数的范围,在该范围内按一定间隔指定取值,然后选择实验结果最好的取值的方法。最终设置如下。

  • 学习率:所有组和模型均为 0.001
  • 训练轮数(epoch):150、162、210 之一
  • Dropout:0 或 0.1
  • 隐藏节点:基础 LSTM 在所有组中为 32,双向 LSTM 为 60、64、32

结果:双向 LSTM 在平均值上略占优势,但难以断言孰优孰劣

各数据组的比较

用各组的测试样本比较了三个模型的 HI 预测误差。论文总结称,在第 1、4、5 组中基础 LSTM 表现最好,在第 2、3、6 组中双向 LSTM 表现最好。

第 1 组的各项指标结果不一致。RMSE(3.189)和 MAE(2.428)以基础 LSTM 最低。但 MAAPE 是双向(7.231)低于基础(9.464)。

双向 LSTM 在不同组之间的差异很大。在第 2 组和第 6 组中,RMSE(单位 %)分别为 1.134 和 1.294,是最低的。相反,在第 4 组和第 5 组中分别为 4.712 和 4.100,是三个模型中最高的。MAAPE 也是如此。第 4 组中基础 LSTM 为 3.764,双向为 10.375。并不是在所有组中都由同一个模型始终领先。

三个模型的平均性能比较

论文把各组的指标按模型求平均后重新比较。平均 RMSE 为基础 3.073、双向 2.997。

图 2. 在四项平均指标中,双向 LSTM 有三项最低,但与基础 LSTM 的差距很小。

双向 LSTM 在 RMSE、nRMSE 和 MAAPE 三个指标上最低。只有 MAE 是基础(2.394)低于双向(2.462)。论文以这一平均值比较为依据,得出双向 LSTM 的预测精度最高的结论。

两个模型的差距并不大。RMSE 平均值之差为 3.073 − 2.997 = 0.076。按组来看,基础 LSTM 在 3 个组中领先。每组的测试样本也只有 1 个。依据中没有检验这一差异是否具有统计显著性的内容。因此,只能说在平均指标上双向 LSTM 略占优势,难以断言两个模型孰优孰劣。

堆叠 LSTM 的四项指标平均值在三个模型中都是最高的。也就是说,在这份数据上,堆叠 LSTM 的平均误差最大。

预测 RUL 与实际 RUL

最后的比较是通过 HI 预测得到的 EOL 与实际 EOL。论文给出了样本 04 和 36 上三个模型的 HI 预测曲线。论文以这些图为依据,叙述实际 EOL 与预测 EOL 的差距不大。因此认为,从退化点算出的实际 RUL 与预测 RUL 也相近。

论文还给出了用基础 LSTM 预测样本 04 并计算 RUL 的案例。不过,依据中没有以时间为单位的数字来整理 EOL 和 RUL 误差的表。因此,对于本文的问题”能否提前计算剩余时间”,答案只停留在通过图形来确认的程度。RUL 精度的定量验证不足,以数值确认的只有 HI 预测指标。

意义与局限

带来了什么变化

  • 液体滤芯的状态诊断和 RUL 预测,不是用物理模型,而是用基于传感器数据的模型完成的。
  • 定义了把移动平均压差转换为 0~1 的 HI。不必分别解读多个指标,就能用一个值读出滤芯状态。
  • 用 K-均值聚类和肘部法找到退化点,并把该点的 HI 用作开始预测的阈值。
  • 用四个指标比较了基础、堆叠和双向 LSTM,在平均指标上双向 LSTM 略占优势。
  • 验证只在使用 PEEK 颗粒与水悬浮液的单一实验装置上进行,但作者认为,由于使用的数据只包含一般液体滤芯的特性,这种方法可应用于多种液体滤芯。

对从业者的价值

要从固定周期更换转向基于状态的维护,需要两个判断依据。一个是”现在是否应该准备更换”,另一个是”能撑到什么时候”。这篇论文的流程分别为这两个问题给出了数字。

第一个问题由 HI 和阈值回答。HI 降到阈值以下、进入异常阶段后,就开始准备更换。第二个问题由预测 HI 到达 0 的时刻之前的 RUL 回答。所需的传感器是滤芯前后的压力和流量。其中,滤芯前后的压力差是检查滤芯性能下降时常用的值。

非专业人员也能读懂 HI。越接近 1 越好,越接近 0 就是故障。设备负责人不必记住压差标准 20,也能判断状态。

对研究者的价值

  • 可以看到,在 HI 实际值小于 1 的预测问题中,用 MAAPE 代替 MAPE 的依据。
  • 可以参考把健康阶段划分与 RUL 预测连成一个流程的设计。把正常区间排除在预测对象之外,从异常阶段开始预测。
  • 三种 LSTM 结构的性能在不同数据组中各不相同,这一结果说明,模型选择需要按组来权衡。
  • 由于使用了公开数据(PHMe20 Data Challenge),可以用同一份数据与其他模型比较。

论文自述的局限

论文自己指出的局限只有一点。这是结论中作为后续研究方向写下的内容。

  • 这项研究只使用了数据驱动模型。通过把物理模型与数据驱动模型结合的混合模型,可以推进液体滤芯的 HI 和 RUL 预测。

笔者认为的适用条件

以下不是论文中的内容,而是笔者着眼于实际应用而补充的条件。

  • 需要有一直记录到故障的数据。这项研究用从开始使用到故障的实验数据进行训练。如果现场一向在滤芯堵塞前就更换,就需要另行收集训练数据。
  • 测试结果来自每组一个样本。在运行条件更加多样的现场,需要增加样本重新验证。
  • 实验使用的是由 PEEK 颗粒和水配制的悬浮液。如果滤芯过滤的是油或其他污染物,堵塞情形可能不同。
  • 阈值因颗粒尺寸而异。45-53 micron 的组为 0.929286、0.928482、0.925179,63-75 micron 的组为 0.852947、0.850569、0.847221。污染物条件改变时,需要重新求阈值。
  • 预测要在进入异常阶段之后才开始。如果更换部件的采购周期很长,应先确认进入异常阶段后剩余的时间是否长于该周期。
  • 故障标准 20 是 Data Challenge 设定的值。对于自己的设备,应代入符合制造商或运行标准的堵塞判定值。

可以马上做的事

  • 从滤芯前后的压力记录中求出压差,用前 7 个值的移动平均生成 MAPD。除以自己设备的堵塞判定值,计算 HI = 1 − MAPD/判定值,并与更换记录一起绘成图。
  • 对记录到故障的 HI 时间序列,让 K 从 1 开始增加并计算 SSE,找出肘部点。确认正常、过渡、异常阶段的边界,并把异常阶段开始处的 HI 记录为阈值。
  • 在阈值以下的区间,训练用前 30 个 HI 预测下一个 HI 的 LSTM。从基础 LSTM 开始,在测试样本上计算 RMSE、MAE、MAAPE,并与双向 LSTM 比较。

关键词

相关文章