航空や発電所など多くの産業で、フィルターは流体中の汚染物質を取り除いています。流体が通過するほど、汚染物質がフィルターに蓄積します。時間が経つとフィルターが目詰まりを起こし、機械の性能低下や故障につながります。
フィルターを決まった周期で交換すると、2つの損失が生じる可能性があります。まだ使えるフィルターを捨ててしまうか、周期が来る前に目詰まりしたフィルターを見逃してしまうかです。現場の管理者に必要なのは、「このフィルターは今どれだけ目詰まりしていて、これからあとどれだけ使えるのか」を示す数値です。
では、フィルターの前後の圧力と流量を記録したセンサーデータだけで、フィルターの状態を診断し、目詰まりするまでの残り時間を事前に計算できるのでしょうか。
この問いに答えた論文を1編読んでみます。
- タイトル: Data-driven health condition and RUL prognosis for liquid filtration systems
- 学術誌: Journal of Mechanical Science and Technology
- 発行年: 2021
- DOI: 10.1007/s12206-021-0323-8
この論文は、液体ろ過システムに用いるデータ駆動型の予知手法を提案しています。まず、フィルターの健全性を表す指数を定義します。次に、その指数がはっきりと低下し始める時点から寿命が尽きる時点までの値を、再帰型ニューラルネットワーク系のモデルで予測し、残存寿命を求めます。この記事で用いる主要な用語は次のとおりです。
- 残存有効寿命(Remaining Useful Life, RUL): 計測時点から、機械が故障と判定される時点までの残り時間です。
- 状態基準保全(Condition-Based Maintenance, CBM): 継続的な監視や点検で集めたデータからシステムの状態を評価し、予測した故障より前に必要な保全を決める方式です。
- 故障予知・健全性管理(Prognostics and Health Management, PHM): 機械の状態を数値で評価し、信頼性を高めて保全コストを減らそうとする工学分野です。CBMで最もよく使われる手法です。
- 健全性指標(Health Index, HI): システム全体の健全性を0から1の間の値で表した定量指標です。
- 差圧(pressure drop): フィルターの上流圧力と下流圧力の差です。
- 劣化点(degradation point): フィルターの性能がはっきりと低下し始める点です。論文は、RULを求めるにはまずこの点を見つける必要があるとしています。
- 寿命終了時点(End of Life, EOL): 予測したHIが0に達する、または0に収束する点です。
動機: フィルターの目詰まりを誰でも読める数値で事前に把握する必要がある
なぜフィルターの寿命予測が重要なのか
論文が挙げる理由は次のとおりです。
- フィルターは、さまざまなシステムが円滑に動くよう支える部品であり、重要な保全対象です。
- 汚染物質がフィルターを詰まらせると、機械の性能低下や故障が生じます。そのため、詰まる前に古い部品を交換する予防保全が、設備管理者にとって重要です。
- 予防保全を効率的に行うには、リアルタイム監視でフィルターの現在の状態を評価し、RULを予測するCBMを適用する必要があります。
- 液体フィルターは、オイルの純度維持や水不足の解決といった課題に使われています。
論文はPHMを、検出、診断、評価、予知の4つの領域に分けています。検出は原因が分からないまま故障を見つけ出し、診断は故障の原因と種類を明らかにします。評価は直近の動作に基づいて機械の健全性を判断し、予知は将来の健全性とRULを予測します。この論文は、HIによる現在の状態の評価と、RULの予知を併せて扱っています。
既存研究が扱っていない部分
論文は、予知モデルを物理モデル(physics-based model)とデータ駆動モデル(data-driven model)に分けています。物理モデルは、装置で起こりうる故障の知識を使い、製品の状態を数式で記述します。他のモデルより故障予知が正確なため、発電所や航空機のように安全が最も重要な産業に向いています。しかし、リアルタイムデータとの連携が難しく、製品ごとに専門知識と多くの資源が必要になるため、汎用的に使うことは困難です。
データ駆動モデルは、収集したデータで装置の故障を予測します。センサー技術が発展し、使用中の製品からリアルタイムでデータを集められるようになったことで、このモデルのRUL推定精度も高まっています。フィルター分野では、Skafらが状態基準の予知手法でフィルターのRULを推定した事例があります。
論文が指摘する空白は3つです。
- 液体フィルターの研究は、他の種類のフィルターの研究より少ないです。
- 既存の液体フィルター研究は、大半が物理モデルを使っていました。物理モデルは実装コストが大きく、複雑なシステムでは正確に作るのが難しいです。
- 既存の予知研究は、システムとの相関が高い指標そのものを予測していました。この方式では複数の指標を把握する必要があり、非専門家がシステムの現在の状態を理解しにくいです。
そこで論文は、HIで状態を評価し故障を予知する研究が必要だと考えています。
手法: 差圧を0〜1の指数に変換し、劣化後の区間をLSTMで予測する
論文は手順を3つの節で説明しています。データの前処理、HIの定義と健全性段階の区分、HIの予測によるRULの算出です。この記事では、2つ目の節をHIの定義と健全性段階の区分に分け、4つのステップで説明します。ステップ1では、ノイズデータを除去し、差圧の大きなばらつきを減らします。ステップ2ではHIを定義し、ステップ3ではK-means法(K-means clustering)で健全性段階を分けます。ステップ4では、3種類の長・短期記憶(Long Short-Term Memory, LSTM)モデルでHIを予測してRULを求め、指標で予測モデルを検証します。
事例とデータ
分析データは、PHMe20 Data Challengeが提供した液体フィルターの目詰まりデータです。実験装置は次の要素で構成されています。
- ポンプと液体タンク: ポンプが一方のタンクの液体をもう一方のタンクへ流します。
- ダンパー: 圧力が上がったときに配管が膨張しないようにします。
- フィルター、圧力・流量センサー: フィルター前後の流量と圧力を監視します。
- データ収集装置: コンピューターに接続され、測定値を記録します。
流した懸濁液は、PEEK粒子と水を混ぜたものです。PEEK粒子は密度が1.3 g/cm3で水に近く、吸水率が0.1 %/24 hと非常に低いです。吸水率が低いと粒子が水中で膨張せず、密度が水に近いと水中により長く浮遊します。
データには、フィルターの使用開始から故障までの記録が含まれています。粒子サイズと固形分比率の組み合わせで6つのグループを作り、グループごとに実験を4回行いました。そのため、データファイルは全部で24個です。ファイルごとに、流量(ml/m)、上流圧力(PSI)、下流圧力(PSI)を0.1秒ごとに記録しました。
グループの構成は、粒子サイズ2区分と固形分比率3水準を組み合わせたものです。粒子サイズは45-53 micronと63-75 micronで、固形分比率は0.4 %、0.425 %、0.45 %です。グループ1〜3が小さい粒子、グループ4〜6が大きい粒子を使いました。
故障判定の基準は、Data Challengeの基準に従います。差圧が20より大きいと、フィルターが目詰まりしたとみなします。各グループで、最初の3つの試料を学習に、最後の1つの試料を試験に使いました。グループ1であれば、01-03を学習に、04を試験に使いました。
ステップ1: ノイズの除去と移動平均
- 入力: 試料ごとの流量、上流圧力、下流圧力(0.1秒間隔)
- 処理: 異常区間の削除、差圧の計算、単純移動平均の適用
- 出力: 移動平均差圧(Moving Averaged Pressure Drop, MAPD)の時系列
処理の手順は次のとおりです。
- 稼働直後で流量が異常に小さい前半部分を削除します。論文は、この区間をシステムが完全稼働に入るまでの時間とみなし、ノイズデータと判断しました。
- 差圧が20以上の区間を削除します。この区間はフィルター故障後も記録され続けたデータであり、分析に必要ないためです。
- 上流圧力から下流圧力を引いて差圧を求めます。
- 差圧に単純移動平均を適用してMAPDを作ります。
移動平均が必要な理由は、0.1秒間隔の測定値のばらつきが非常に大きかったためです。ばらつきをそのままにすると、近い時点でフィルターの状態が急変しているように誤読されるおそれがあります。論文は、予測の安定性と精度を高めるために、ばらつきを減らしました。
MAPD(t)は、時点t-kからtまでのk+1個の区間の差圧の平均です。研究チームは何度も実験してkを6に決め、7個の区間の平均を求めました。測定間隔が0.1秒なので、1つの平均は7×0.1=0.7秒間の差圧をまとめた値です。MAPDが0であれば上流と下流の圧力が等しいことを意味し、フィルターの状態が最も良好です。MAPDが20であればフィルター故障です。
ステップ2: 健全性指標の定義
- 入力: MAPDの時系列
- 処理: 故障基準の20で割って0〜1の範囲に変換
- 出力: 時点ごとのHI
フィルターの性能低下を確認する際は、流体がフィルターを通過する前後の圧力差を使うのが一般的です。そこで論文は、MAPDを0から1の間の値に変換したHIを作りました。式はHI(t) = 1 − MAPD(t)/20です。
HIが1であれば最適な状態であり、HIが0に達する、または0に収束する時点がEOLです。このように変換すれば、フィルターの故障基準を知らない非専門家でもフィルターの状態を確認できます。
計算例を示します。MAPDが0であればHI = 1 − 0/20 = 1であり、MAPDが20であればHI = 1 − 20/20 = 0です。逆に、HIの値からMAPDを求め直すこともできます。ステップ3で出てくるグループ1の閾値HI 0.929286は、MAPDでは(1 − 0.929286)×20 = 1.41428 PSIに相当します。
ステップ3: K-means法による健全性段階の区分
- 入力: 試料ごとのHI時系列
- 処理: エルボー法でクラスター数を決め、K-meansクラスタリングを実行
- 出力: 3つの健全性段階(正常、遷移、異常)と、劣化点でのHI(閾値)
システムが稼働を始めたばかりのときは、HIの変化が小さいです。性能が低下していない状態では、RULを正確に推定するのは困難です。実際に、HIの大半が正常段階か遷移段階に集中していました。そこで論文は、健全性段階を先に分け、フィルターが正常に作動しなくなる劣化点を探しました。
処理の手順は次のとおりです。
- クラスター数Kを1から増やしながら、誤差平方和(Sum of Squared Error, SSE)を求めます。SSEは、クラスターの中心とそのクラスターに属するデータとの距離で計算します。
- SSEが急速に減少し、その後ほとんど変わらなくなる点、つまりエルボー点を探します。その点のKが最適なクラスター数です。
- 決めたKでK-meansクラスタリングを実行します。K-meansクラスタリングは、決めた数のクラスターを作り、各データを最も近いクラスターに割り当てる手法です。
- 遷移段階と異常段階の境界を劣化点とし、この点のHIを閾値とします。
K-meansクラスタリングは、PHMで健全性段階を分ける際によく使われる手法です。ベアリングの健全性段階を4つのクラスターに分けた研究や、風速計の健全性段階を区分した研究があります。
この事例では、Kを増やしたときのSSEの変化率は、Kが3になるまで74.9 %、13.8 %でした。その後は、変化率が5 %未満にとどまりました。そのため、K=3がエルボー点になりました。すべての実験データでエルボー点が3となったため、クラスター数を3に統一しました。健全性段階は、正常(healthy)、遷移(transitional)、異常(unhealthy)の3段階です。
グループごとの閾値は、粒子サイズによって差がありました。45-53 micronのグループ(グループ1〜3)は0.929286、0.928482、0.925179でした。63-75 micronのグループ(グループ4〜6)は0.852947、0.850569、0.847221でした。グループ6の閾値をMAPDに戻すと、(1 − 0.847221)×20 = 3.05558 PSIです。
ステップ4: LSTMによるHI予測とRULの算出
- 入力: 直近30時点のHI系列
- 処理: LSTMで次の時点のHIを予測し、予測値を再び入力に入れて反復
- 出力: 予測HI曲線、予測EOL、RUL、性能指標4つ
LSTMは、時系列予測によく使われる再帰型ニューラルネットワーク(Recurrent Neural Network, RNN)から生まれました。RNNは、前方の情報を長時間後に使うと学習能力が大きく低下します。LSTMはセル状態(cell state)を加えることで、この問題を補います。セル内の層と演算が入力情報を選択して受け取るため、長い系列でも情報を保持したり修正したりできます。
処理の手順は次のとおりです。
- 入力は、現在の時点tを含む直近30時点のHI、つまり[HI(t−29), …, HI(t)]です。出力は、次の時点のHI(t+1)です。
- 入力系列のすべての値が閾値より低ければ、フィルターが異常段階に入ったと判断して予測を開始します。
- 直前の予測結果を再び入力に入れます。次の入力は[HI(t−28), …, HI(t), HI(t+1)]で、出力はHI(t+2)です。
- 予測HIが0に達する時点をEOLとし、予測開始時点との差からRULを求めます。
RULの式はRUL(t_n) = t_EOL − t_nです。t_EOLはEOLの時点で、t_nは計測時点です。予測を異常段階から始める理由は、フィルターが正常に作動しているときはRULを予測しにくいためです。
予測性能は、4つの指標で評価しました。
- 二乗平均平方根誤差(Root Mean Square Error, RMSE): 予測誤差の標準偏差です。実際の値と予測値の差を二乗して平均し、その平方根を求めます。
- 正規化RMSE(normalized RMSE, nRMSE): RMSEを実際の値の平均で割った値です。モデル間で単位をそろえて比較できるようにします。
- 平均絶対誤差(Mean Absolute Error, MAE): 予測値と実際の値の差の絶対値を平均した値です。すべての差に同じ重みを与えます。
- 平均アークタンジェント絶対パーセント誤差(Mean Arctangent Absolute Percentage Error, MAAPE): 実際の値に対する誤差の比率にアークタンジェントをかけて平均します。
MAAPEを使った理由があります。よく使われる平均絶対パーセント誤差(Mean Absolute Percentage Error, MAPE)は、実際の値が0のとき計算できません。実際の値が1より小さいと、無限大に近い値が出ます。この研究のHIの実際の値はすべて1より小さかったため、MAAPEを使いました。
バリエーションとシナリオ: 3種類のLSTM構造とハイパーパラメータ
論文はLSTMを3つの構造に分けて比較しました。
- バニラLSTM: 1層からなる基本的なLSTM
- 積層(stacked)LSTM: 複数の層を重ねたLSTM
- 双方向(bidirectional)LSTM: 順方向と逆方向の両方で学習するLSTM
3つの構造はいずれも、PHMの故障予知で主に使われます。論文は先行研究の事例として2つを紹介しています。航空機の推進機関のRULを双方向LSTMで予測した研究と、燃料電池のRULを積層LSTMで予測した研究です。
学習設定は、グループとモデルに応じて調整しました。活性化関数はElu、バッチサイズは1、最適化手法はAdamでした。研究チームは、グリッドサーチ(grid search)でハイパーパラメータを決めました。グリッドサーチは、ハイパーパラメータの範囲を定め、その範囲内で一定間隔ごとに値を指定し、最も良い実験結果を出した値を選ぶ手法です。最終的な設定は次のとおりです。
- 学習率: すべてのグループとモデルで0.001
- エポック: 150、162、210のいずれか
- ドロップアウト: 0または0.1
- 隠れノード: バニラはすべてのグループで32、双方向は60、64、32
結果: 双方向LSTMが平均でわずかに上回ったが、優劣は断定しにくい
データグループ別の比較
各グループの試験試料で、3つのモデルのHI予測誤差を比較しました。論文は、グループ1、4、5ではバニラLSTMが、グループ2、3、6では双方向LSTMが最も良い性能を示したとまとめています。
グループ1は、指標ごとに結果が異なりました。RMSE(3.189)とMAE(2.428)はバニラが最も低くなりました。しかしMAAPEは、双方向(7.231)がバニラ(9.464)より低くなりました。
双方向LSTMは、グループによる差が大きくなりました。グループ2とグループ6では、RMSE(単位 %)が1.134と1.294で最も低くなりました。一方、グループ4とグループ5では4.712と4.100で、3つのモデルのうち最も高くなりました。MAAPEも同様です。グループ4では、バニラは3.764、双方向は10.375でした。すべてのグループで1つのモデルが常に上回ったわけではありません。
3つのモデルの平均性能の比較
論文は、グループ別の指標をモデルごとに平均して、改めて比較しました。平均RMSEは、バニラが3.073、双方向が2.997でした。
双方向LSTMは、RMSE、nRMSE、MAAPEの3つの指標で最も低くなりました。MAEのみ、バニラ(2.394)が双方向(2.462)より低くなりました。論文は、この平均の比較を根拠に、双方向LSTMの予測精度が最も高いと結論づけました。
2つのモデルの差は大きくありません。RMSE平均の差は3.073 − 2.997 = 0.076です。グループ別では、バニラが3つのグループで上回りました。試験試料もグループあたり1個だけです。根拠には、この差が統計的に有意かどうかを検討した内容がありません。そのため、平均指標で双方向がわずかに上回ったところまでしか言えず、2つのモデルの優劣を断定するのは難しいです。
積層LSTMは、4つの指標の平均がいずれも3つのモデルの中で最も高くなりました。つまり、このデータでは積層LSTMの平均誤差が最も大きくなりました。
予測RULと実際のRUL
最後の比較は、HI予測で得たEOLと実際のEOLです。論文は、試料04と36で、3つのモデルのHI予測曲線を示しました。論文はこのグラフを根拠に、実際のEOLと予測EOLの差は大きくないと述べています。そのため、劣化点から求めた実際のRULと予測RULも近いと判断しました。
論文は、試料04をバニラLSTMで予測してRULを算出した事例も示しています。ただし、EOLとRULの誤差を時間単位の数値でまとめた表は、根拠にありません。したがって、この記事の問いである「残り時間を事前に計算できるのか」に対する答えは、グラフで確認する程度にとどまります。RUL精度の定量的な検証は不足しており、数値で確認されたのはHI予測の指標のみです。
意義と限界
何が変わるのか
- 液体フィルターの状態診断とRUL予知を、物理モデルではなくセンサーデータに基づくモデルで行いました。
- 移動平均差圧を0〜1に変換したHIを定義しました。複数の指標を別々に解釈しなくても、フィルターの状態を1つの値で読み取れます。
- K-means法とエルボー法で劣化点を見つけ、その時点のHIを予測開始の閾値として使いました。
- バニラ、積層、双方向のLSTMを4つの指標で比較し、平均指標では双方向LSTMがわずかに上回りました。
- 検証は、PEEK粒子と水の懸濁液を使った単一の実験装置でのみ行われましたが、著者らは、一般的な液体フィルターの特性のみを含むデータを使ったため、さまざまな種類の液体フィルターに適用できるアプローチだと考えています。
実務者にとっての有用性
固定周期の交換から状態基準保全に切り替えるには、2つの判断根拠が必要です。1つは「今、交換を準備すべきか」で、もう1つは「いつまでもつのか」です。この論文の手順は、2つの問いにそれぞれ数値を与えます。
最初の問いには、HIと閾値が答えます。HIが閾値を下回って異常段階に入れば、その時点から交換を準備します。2つ目の問いには、予測HIが0に達する時点までのRULが答えます。必要なセンサーは、フィルター前後の圧力と流量です。このうち、フィルター前後の圧力差は、フィルターの性能低下を確認する際によく使われる値です。
HIは、非専門家でも読めます。1に近ければ良好で、0に近ければ故障です。設備担当者が差圧基準の20を覚えていなくても、状態を判断できます。
研究者にとっての有用性
- HIの実際の値が1より小さい予測問題で、MAPEの代わりにMAAPEを使った根拠が分かります。
- 健全性段階の区分とRUL予測を1つの手順につなげた設計を参考にできます。正常区間を予測の対象から外し、異常段階から予測を始めます。
- 3つのLSTM構造の性能がデータグループごとに異なったという結果は、モデル選定をグループごとに検討すべき理由になります。
- 公開データ(PHMe20 Data Challenge)を使っているため、同じデータで他のモデルと比較できます。
論文が示す限界
論文自身が示している限界は1つです。結論で今後の研究の方向として書かれている内容です。
- この研究は、データ駆動モデルのみを使いました。物理モデルとデータ駆動モデルを組み合わせたハイブリッドモデルで、液体フィルターのHIとRULの予知を発展させることができます。
筆者が考える適用条件
以下は論文に書かれた内容ではなく、筆者が実務への適用を念頭に付け加える条件です。
- 故障まで最後まで記録したデータが必要です。この研究は、使用開始から故障まで記録した実験データで学習しました。現場でフィルターを詰まる前に交換してきたのであれば、学習用データを別に集める必要があります。
- 試験結果は、グループごとに1つの試料から得られたものです。運転条件がより多様な現場では、試料を増やして再検証する必要があります。
- 実験は、PEEK粒子と水で作った懸濁液を使いました。オイルや他の汚染物質をろ過するフィルターでは、目詰まりの様相が異なる可能性があります。
- 閾値は粒子サイズによって異なりました。45-53 micronのグループは0.929286、0.928482、0.925179で、63-75 micronのグループは0.852947、0.850569、0.847221でした。汚染物質の条件が変われば、閾値を求め直す必要があります。
- 予測は、異常段階に入ってからでないと始まりません。交換部品の調達にかかる期間が長い場合は、異常段階に入ってからの残り時間がその期間より長いかどうかを、まず確認する必要があります。
- 故障基準の20は、Data Challengeが定めた値です。自社の設備には、メーカーや運転基準に合った目詰まり判定値を入れる必要があります。
すぐに試してみること
- フィルター前後の圧力記録から差圧を求め、直近7個の値の移動平均でMAPDを作ります。自社設備の目詰まり判定値で割ってHI = 1 − MAPD/判定値を計算し、交換履歴とともにグラフに描いてみます。
- 故障まで記録したHI時系列に対し、Kを1から増やしながらSSEを計算し、エルボー点を見つけます。正常、遷移、異常の各段階の境界を確認し、異常段階が始まるHIを閾値として記録します。
- 閾値を下回る区間で、直近30個のHIから次のHIを予測するLSTMを学習します。バニラLSTMから始め、試験試料でRMSE、MAE、MAAPEを計算して、双方向LSTMと比較します。