フェロアロイ電気炉工場の環境担当者が最も困るのは、煙突の窒素酸化物(nitrogen oxides, NOx)濃度が突然跳ね上がるときです。韓国では、煙突に設置した遠隔測定器がNOxを5分平均で集計します。30分平均が許容基準(例:60 ppm)を連続で3回超えるか、1週間に8回超えると、違反として扱われます。違反すると、高額な過料や操業停止などの行政処分を受けます。
基準を超えてから動くと、NOxを下げることがいっそう難しくなり、より強力で費用のかかる対策が必要になります。そこで問いは次のとおりです。工程データだけで、NOx急増の直前の兆候を事前に察知できるのでしょうか。
この問いに答えた論文を一本読んでみます。
- タイトル: Early detection of NOx spikes in ferroalloy electric arc furnace plants
- 学術誌: Process Safety and Environmental Protection
- 年: 2026
- DOI: 10.1016/j.psep.2025.108253
この論文は、電気炉(Electric Arc Furnace, EAF)の運転データと測定データから、NOx急増直前の状態を見分ける方法を提案しています。モデルは長短期記憶オートエンコーダ(Long Short-Term Memory Autoencoder, LSTM-AE)です。このモデルは正常運転のデータだけを学習します。新しい入力をうまく復元できなければ、その時点を警報と判定します。
この記事で使う用語は次のとおりです。
- 急増(spike): NOx濃度が、通常の分布から定めた上限を超えた時点。
- 早期警戒状態(early warning): 急増が起こる直前の時点。
- 再構成誤差(reconstruction error): モデルが入力を圧縮してから再び展開した値と、元の入力との差。この差が大きいと、モデルにとって初めて見るパターンであることを意味します。
動機: 基準を超える瞬間は短くまれなため、既存の予測モデルでは見逃される
なぜNOx急増を事前に知る必要があるのか
論文が挙げる理由は次のとおりです。
- 電気炉内の温度は1600 ◦Cを超えることがあります。この温度では、空気中の窒素と酸素が反応してサーマルNOxが生じます。
- 大気中に出たNOxは、日光の下で微小粒子状物質やオゾンなどの二次汚染物質になります。この物質は、呼吸器・心血管疾患や生態系の損傷に影響します。
- 欧州の産業排出指令、韓国の大気環境保全法、大気汚染物質総量管理制度が、NOxを厳しく規制しています。
- 電気炉の排ガスは、半乾式反応器(Semi-Dry Reactor, SDR)で硫黄酸化物を減らし、バグフィルタで粉じんを除去します。しかしNOxは、ほとんど処理されないまま煙突から排出されます。
- 原料投入が不規則で、燃料組成や燃焼条件が変わると、NOxが短時間で跳ね上がります。この急増は、環境被害とともに経済的損失を生みます。
専用のNOx低減設備である選択的触媒還元(Selective Catalytic Reduction, SCR)では、触媒交換とアンモニア注入の費用が継続的にかかります。論文は、早期検知をSCRや選択的非触媒還元(Selective Non-Catalytic Reduction, SNCR)と併用する補完手段と位置づけています。費用を抑えながら規制を守るのに役立つという判断です。
既存研究が扱っていない部分
NOxの研究は、ほとんどが排出濃度そのものを予測する回帰モデルを作ってきました。電気炉では、カルマンフィルタでノイズを減らした後にLSTMでNOxを予測し、SHAP(Shapley Additive Explanations)で主要な変数を探した研究があります。火力発電や焼却炉でも、変数選択、外れ値除去、平滑化を経た予測モデルが多数出ています。
これらのモデルは、NOxと運転変数の関係を明らかにするのに役立ちます。しかし論文は、次のような隙間を指摘しています。
- 急増はデータの中でごくわずかな割合であるため、モデルの学習にほとんど寄与しません。
- 外れ値除去や平滑化といった前処理が、急増そのものを消してしまいます。
- 回帰モデルは、二乗平均平方根誤差(RMSE)や決定係数(R2)のような連続値の予測指標で評価されます。これらの指標は全体的な予測能力を示すだけで、まれな事象を事前に捉える能力を個別に評価するものではありません。
- 製紙設備の故障、蒸気タービン、砂塵、都市ガス配管の漏洩では、早期警戒の研究がありました。しかし、電気炉のNOx急増を直接扱った研究はまれです。
- 電気炉は環境が過酷で、センサの設置や管理が難しい状況です。急増直前の微細な変化を捉える高性能センサを備えることも困難です。
方法: 正常状態のみを学習したモデルが、見慣れないパターンを警報として知らせる
論文は方法を四つのステップで説明しています。ステップ1では、NOxと相関の高い変数を決めます。ステップ2では、四分位範囲(Interquartile Range, IQR)で急増を定義し、急増直前の時点に早期警戒ラベルを付けてからデータを分割します。ステップ3では、正常データのみでLSTM-AEを学習し、適合率-再現率曲線で警報の閾値を決めます。ステップ4では、テストデータの再構成誤差が閾値を超えたら早期警戒に分類し、複数の指標で性能を評価します。
事例とデータ
分析対象は、韓国のフェロアロイ生産現場です。期間は2023年3月10日から12月31日までの297日間です。データは3か所から5分平均で収集しました。
- 電気炉: 電極深さ、電力使用量、冷却水流量、集じんダクト温度など8変数。
- 排ガス浄化設備: SDR入口・出口温度、バグフィルタ圧力、誘引送風機電力など6変数。
- テレモニタリングシステム(Tele-Monitoring System, TMS): 排ガスのNOx、SOx、酸素、粉じん、温度、流量の6変数。
変数は合計で8+6+6=20個です。元データは58,965件です。
研究チームは、メンテナンスや一時停止のため、7月15日から10月1日までのデータを除外しました。NOxが6回を超えて連続で欠測、または0になっている区間も異常とみなして除外しました。残った欠測値は、前後の値をつなぐ線形補間で埋めました。その結果、53,250件が残り、元データの約10 %が除かれました。
ステップ1: NOxと連動する変数を決める
- 入力: 20個の運転・測定変数の5分平均時系列
- 処理: ピアソン相関係数の計算、専門家によるレビュー
- 出力: モデルに入力する7個の変数
- 変数ごとに、NOxとのピアソン相関係数を計算します。
- 絶対値が0.30より大きい変数を候補として選びます。
- 現場のエンジニア、工程管理者、研究者が、候補の物理的な妥当性をレビューします。
相関係数は−1から+1の間の値です。±1に近いほど二つの変数が直線的な関係で共に動き、0に近いと関係が弱いことを示します。0.30は、0.30〜0.70を中程度の相関とみる慣例に従った値です。研究チームは、非線形な関係をすべて捉えることよりも、専門家が素早くレビューできる候補を直感的に絞り込むことを選びました。
基準を超えた変数は6個でした。
- 排ガス酸素: |r| ≈ 0.86
- 排ガス温度: |r| ≈ 0.57
- 排ガスSOx: |r| ≈ 0.49
- 電力使用量: |r| ≈ 0.37
- 排ガス粉じん: |r| ≈ 0.34
- 電極深さ: |r| ≈ 0.32
専門家レビューでは、次のような意見が出ました。排ガス温度が高いと燃焼反応が速まり、NOxが増えます。電力入力が変動するとアークの強さや温度が変動し、NOxに影響します。電極深さは炉内部の運転条件を反映します。最終的な入力は、NOx自身を加えた7個の変数です。
ステップ2: 急増を定義し、直前の時点に警報ラベルを付ける
- 入力: 53,250件のNOx時系列
- 処理: IQR上限の計算、時間シフトによるラベル付け、区間単位の分割
- 出力: 正常・早期警戒のラベルと、学習・検証・テストデータ
- NOxの全体分布から、第1四分位数(Q1)と第3四分位数(Q3)を求めます。
- 上限(UB)をQ3 + 1.5 × (Q3 − Q1)で計算し、上限を超えた時点を急増として記録します。
- 急増の直前の時点に早期警戒ラベルを付け、急増の時点そのものはデータから除きます。
- データを20個の区間に分け、学習・検証・テストにランダムに割り当てます。
IQR法は、データが正規分布に従うことを仮定しません。そのため、一方に偏った排出データに適しています。このデータのNOxは、平均28.32 ppm、標準偏差17.60 ppmで、範囲は0〜458.95 ppmでした。Q1は16.36 ppm、Q3は38.66 ppmです。IQRは38.66 − 16.36 = 22.30で、上限は38.66 + 1.5 × 22.30で計算され、論文は72.10 ppmと報告しました。
この上限を超えたデータは全体の0.25 %でした。正常データとの比率は約400:1です。急増は105件でした。平均継続時間は約6分、中央値は5分、最長は25分でした。
研究チームは、平均に標準偏差の3倍を加える3シグマ方式とも比較しました。この方式の基準は約81.12 ppmで、韓国の規制基準60 ppmよりかなり高い値です。IQRの上限のほうが規制基準に近く、現場の基準として使うのに適しているという判断です。
ラベルは時間シフト(time-shifting)方式で付けました。たとえば時点tに急増が起こり、シフト長が2ステップなら、t−2とt−1が早期警戒になります。1ステップは5分です。研究チームは、1〜4ステップ(5〜20分)をすべて試しました。
シフト長によって、早期警戒データの量が変わります。1ステップ(5分)とすると、正常は53,116件、早期警戒は106件(0.20 %)です。4ステップ(20分)に延ばすと、早期警戒は378件(0.71 %)になります。どの長さにしても、早期警戒は1 %に満たない割合です。
分割方式にも理由があります。フェロアロイ工程は、日ごと、月ごとに生産量や原料が異なり、早期警戒が特定の期間に集中します。時間順に分割すると、テスト区間に警報がほとんどない可能性があります。そこで、20個の区間のうち12個を学習、4個を検証、4個をテストにランダムに割り当てました。代表的な結果(乱数シード50)では、学習31,866件、検証10,620件、テスト10,622件になりました。ラベルを付けた後は、最小-最大正規化で変数の範囲をそろえました。
ステップ3: 正常データでLSTM-AEを学習し、閾値を決める
- 入力: 学習・検証区間の正常データ(7変数)
- 処理: LSTM-AEの学習、グリッドサーチ、適合率-再現率曲線の作成
- 出力: 学習済みモデルと警報の閾値
- エンコーダが、短い時系列を小さなベクトルに圧縮します。
- デコーダが、そのベクトルから元の時系列を復元します。
- 平均二乗誤差が小さくなるように重みを調整します。
- 検証データで適合率-再現率曲線を描き、閾値を決めます。
平均二乗誤差は、元の値と復元した値の差を二乗して平均した値です。正常なパターンだけを学習したモデルは、正常な入力をうまく復元でき、誤差が小さくなります。初めて見るパターンが入力されると、誤差が大きくなります。
モデルの構造は次のとおりです。
- エンコーダ: 32ユニットのLSTM層に続き、16ユニットの層が固定長ベクトルを作ります。
- 反復層: このベクトルを入力長の分だけ複製します。
- デコーダ: 16ユニットのLSTM層に続き、32ユニットの層を置きます。
- 出力層: 時点ごとに7個の変数を返し、入力と形状をそろえます。
グリッドサーチの範囲は次のとおりです。入力長1〜8、学習率0.001〜0.01、反復回数30・60・100・200、バッチサイズ32・64・128・256、早期終了の許容回数5・6・8です。最適化アルゴリズムはAdamとしました。
正解ラベルを直接学習する分類モデルを使わなかった理由は、不均衡です。この種のモデルは多数派に偏りやすく、まれな事象を見逃しがちです。トランスフォーマーや敵対的生成ネットワーク(Generative Adversarial Network, GAN)も検討しました。しかし、53,250件はこれらのモデルを学習するには少なく、急増の検知には短い入力のほうが効果的であるため除外しました。
閾値は、検証データの適合率曲線と再現率曲線が交わる点として決めました。入力長2、シフト長1ステップのモデルでは、この値は0.00595でした。再構成誤差が0.00595を超えれば早期警戒、超えなければ正常です。
ステップ4: テストデータの分類と性能評価
- 入力: テストデータとステップ3の閾値
- 処理: 再構成誤差の計算、混同行列の作成、指標の計算
- 出力: 適合率、再現率、F1スコア、AUC、MCC
- テストデータをモデルに入力し、再構成誤差を求めます。
- 閾値と比較し、正常と早期警戒に分類します。
- 実際のラベルと照合し、真陽性・偽陽性・真陰性・偽陰性を集計します。
- 五つの指標を計算します。
指標の意味は次のとおりです。
- 適合率: 警報を出したもののうち、実際に早期警戒だったものの割合。
- 再現率: 実際の早期警戒のうち、モデルが見つけ出したものの割合。
- F1スコア: 適合率と再現率の調和平均。2 × 適合率 × 再現率 ÷ (適合率 + 再現率)で計算します。
- AUC(Area Under the ROC Curve): 閾値を変えながら描いた受信者動作特性曲線の下の面積。1に近いほど、二つの集団をよく分けられます。
- MCC(Matthews Correlation Coefficient): 混同行列の四つの値をすべて使う指標で、−1から+1の間をとります。不均衡データでよく使われます。
計算例を一つ挙げます。最終モデルの適合率は0.350、再現率は0.212です。F1スコアは2 × 0.350 × 0.212 ÷ (0.350 + 0.212) = 0.1484 ÷ 0.562 = 0.264です。研究チームは、不均衡データでは適合率か再現率の一方だけを見ると判断を誤りかねないため、F1スコアを優先基準にしました。
変形とシナリオ
結果を左右する設定は三つあります。
- シフト長: 長くするほど、早期警戒データが増えます(1ステップ106件、4ステップ378件)。グリッドサーチの上位5モデルのうち4つが、1ステップ(5分)でした。
- 閾値の選択: リスク予防を優先する現場は再現率に、工程の安定を優先する現場は適合率に重みを置けます。規制基準に合わせた固定値も使えます。
- 急増基準の期間: 研究チームは、全体分布で単一の基準を定めました。日別・月別に基準を別々に設ける方式は、今後の課題として残しました。
結果: 7変数とLSTM-AEの組み合わせがF1 0.264で最も高かった
シフト長と入力長の組み合わせの比較
研究チームは、グリッドサーチで作ったモデルをF1スコアの順に比較しました。1位は、シフト長1ステップ、入力長2ステップの組み合わせでした。F1スコア0.264、AUC 0.768、MCC 0.271です。2位(入力3ステップ)はF1 0.259、3位(入力1ステップ)は0.250でした。シフト長2ステップの組み合わせはF1 0.217で、5位でした。
このデータでは、シフト1ステップ、入力2ステップの組み合わせのF1が最も高くなりました。急増の5分前の兆候が、10分前よりも明確だったためかもしれません。ただし、これは筆者の推測であり、論文が立証した内容ではありません。
入力変数の決め方の比較
次は、入力変数の構成を変えた比較です。NOxだけを入力したモデルは、F1 0.217、AUC 0.622でした。全変数を入力したモデルは、F1 0.235、AUC 0.770でした。7変数モデルは、F1 0.264、MCC 0.271で、F1とMCCが最も高くなりました。
F1とMCCの基準では、7変数モデルが上回りました。AUCは、全変数モデル(0.770)と7変数モデル(0.768)が同程度でした。全変数モデルは、NOxのみのモデルよりF1が高かったものの、7変数モデルよりは低くなりました。この比較は、このデータの一つの分割から得られた結果です。
他のモデルとの比較
LSTM-AEを、五つのベースラインモデルと比較しました。ベースラインモデルは、LSTM、AE(Autoencoder)、VAE(Variational Autoencoder)、DNN(Deep Neural Network)、XGBoostです。LSTM-AEとLSTMは複数の時点を入力として受け取り、その他は一時点の7変数だけを受け取ります。
主要な数値は次のとおりです。
- LSTM-AE: 適合率0.350、再現率0.212、F1 0.264。
- LSTM: 適合率0.161、再現率0.476、F1 0.241。
- DNN: 適合率0.144、再現率0.485。
- VAE: AUC 0.782、F1 0.208。
LSTM-AEは、F1スコアとMCC(0.271)で最も高くなりました。LSTMとDNNは再現率が高いものの適合率が低く、誤警報が多くなります。AUCはVAEが最も高かったものの、決められた閾値でのF1は最も低くなりました。F1の基準ではLSTM-AEが最も高かったものの、モデル間の差は大きくありませんでした。一時点だけを入力するAEのF1(0.235)も、LSTM(0.241)とほぼ同じでした。
規制基準をそのまま使う方式との比較
現場で最も思いつきやすい代替案は、NOxが一定値を超えたら警報を出す方式です。研究チームは、基準を40〜70 ppmに変えながら、この方式を評価しました。
基準を下げると再現率は上がりますが、適合率が下がります。シフト1ステップで基準を40 ppmにすると、再現率は0.788ですが、適合率は0.011で、F1は0.021にとどまります。60 ppmでは、適合率0.057、再現率0.364、F1 0.098です。表でF1が最も高い組み合わせは、4ステップ・60 ppmの0.206でした。
この方式のF1スコアは、最も高くても0.21です。規制基準を超えたからといってすぐ急増が来るわけではないため、誤警報が多く発生します。
論文は、LSTM-AEのF1スコアがこの方式より6〜9 %高いと記しています。論文は、この値が%ポイントの差なのか相対比なのかを明示していません。数値上は、F1値の%ポイント差と一致します。テストデータでは、0.264 − 0.206 = 0.058、つまり約6 %ポイントの差です。追加データのF1 0.30を、単純な閾値方式で最も高かったF1 0.21と比べると、0.30 − 0.21 = 0.09、つまり9 %ポイントの差です。
安定性、追加データ、計算負荷
乱数シードを10、42、44、50に変えてデータを再分割しても、F1とMCCの変動は±1.5 %以内でした。学習に使っていない2024年1月1〜24日のデータでは、適合率、再現率、F1スコアがいずれも0.30でした。研究チームはこの結果を根拠に、モデルが過学習していないと判断しました。ただし、同じ現場の24日分のデータであるため、一般化するにはさらに多くの検証が必要です。
モデルのパラメータは約16,871個です。一般的なワークステーションで、1件の推論に平均20.6 msかかり、毎秒約48件を処理しました。TMSが5分ごとに値を保存するため、リアルタイム運用には十分な速度です。
F1 0.26〜0.30は低く見えます。研究チームは、急増直前の時点が正常と非常によく似ており、早期警戒の割合が0.20〜0.71 %にとどまるためだと説明しています。時間シフトラベルで故障を事前に検知した先行研究も、F1 0.10を報告しています。
意義と限界
何が変わるのか
- NOx研究の問いを、「濃度はいくらか」から「まもなく急増が来るか」へ変えました。
- 外れ値として消していた急増をむしろ分析対象とし、直前の時点にラベルを付けました。
- 急増の基準をIQRで定め、3シグマ方式や韓国の規制基準と比較して妥当性を確認しました。
- 正常データだけを学習する再構成方式で、約400:1の不均衡を扱いました。
- 五つのベースラインモデルと単純な閾値方式に対して性能を比較して示しました。
実務者にとっての有用性
このモデルは、5分平均で収集した既存の運転・測定データで動きます。論文は、警報を電力入力、電極深さ、冷却水流量の調整に活用して炉の状態を安定させられると提案しています。この調整の効果は検証していません。SCRやSNCRがある現場では、警報に合わせてアンモニア注入量をリアルタイムで調整できます。モデルが軽量なため、既存の制御システムに組み込みやすい点もあります。
研究者にとっての有用性
時間シフトラベルと再構成誤差を組み合わせた設計は、セメントキルン、焼却炉、火力発電のように、排出がときどき跳ね上がる他の高温工程にも転用できます。適合率-再現率曲線から閾値を決める手順や、分布基準と規制基準を比較する手順は、他の汚染物質の研究でもそのまま使えます。不均衡が極端な問題でF1 0.26〜0.30がどの程度の水準なのかを判断するための比較資料も、この論文から得られます。
論文が示した限界
論文が自ら示した限界は六つあります。
- データの期間と範囲: フェロアロイ電気炉のデータだけを使いました。季節変動や工程の変化を反映するには、より長い期間のデータが必要であり、合金の種類・炉の運転・原料条件が異なる工程でも検証する必要があります。
- 変数の遅延効果: 工程変数がNOxにすぐには影響しない場合がありますが、遅延時間を精緻に合わせられませんでした。
- モデル構造: LSTM-AE一つに頼りました。データが蓄積されたら、トランスフォーマーやGANを試す必要があります。
- 測定間隔: 5分平均では、速い燃焼反応の途中の変化をすべては捉えられません。1秒、30秒、1分の間隔も試す必要があります。
- 変数選定: ピアソン相関は線形関係しか見ません。非線形な関係を捉える手法が必要です。
- 固定閾値: 急増の基準と警報の閾値を一つに固定しました。期間別の基準や動的な閾値は、今後取り組む課題です。
筆者が考える適用条件
以下は論文に書かれた内容ではなく、筆者が実務への適用を念頭に置いて付け加える条件です。
- 誤警報に対応できる運用手順が必要です。適合率0.350は、警報100件のうち実際に早期警戒だったものが約35件にとどまるという意味です(100 × 0.350 = 35)。残りの65件(100 − 35)に運転員がどう反応するかを、あらかじめ決めておく必要があります。
- 急増の事例が、検証区間に十分に含まれている必要があります。閾値を適合率-再現率曲線で決めるため、検証データに早期警戒が少ないと閾値が不安定になります。
- 実際の運用では、過去のデータで未来を判断します。ランダムな区間分割で得た性能をそのまま期待するよりも、時間順に分割したテストをもう一度行うほうが安全です。
- 原料や設備が変わったら、IQRの上限と閾値を再計算する必要があります。
すぐに試せること
自分の工場のTMSデータで、論文の手順の最初のステップをなぞってみることができます。
- 5分平均のNOxデータからQ1とQ3を求め、Q3 + 1.5 × (Q3 − Q1)で上限を計算します。この上限を、自分の事業所の規制基準と並べて比較します。
- 上限を超えた急増の件数、平均継続時間、最長継続時間を集計します。急増の直前1ステップ(5分)に早期警戒ラベルを付けたとき、その割合が全体の何 %になるかを確認します。
- 運転変数ごとにNOxとのピアソン相関係数を求め、絶対値が0.30を超える変数を絞り込みます。このリストを現場のエンジニアと一緒にレビューし、物理的に説明できる変数だけを残します。