电弧炉 NOx 骤增,能提前察觉吗

仅凭工艺数据,能否提前察觉铁合金电炉的NOx骤增?本文探讨仅用正常运行数据训练的LSTM自编码器在骤增前5分钟识别出预警信号的表现与局限。

本文译自韩文原文。 韩文原文

铁合金电弧炉工厂的环保负责人最为难的时候,是烟囱中的氮氧化物(nitrogen oxides, NOx)浓度突然飙升。在韩国,安装在烟囱上的远程监测仪以 5 分钟平均值采集 NOx。如果 30 分钟平均值连续三次超过允许标准(例如 60 ppm),或者一周内超标八次,就会被认定为违规。违规会受到高额罚款或停产等行政处罚。

超标之后再采取行动,降低 NOx 会更加困难,需要更强、更昂贵的措施。因此问题是这样的:仅凭工艺数据,能否提前察觉 NOx 骤增之前的信号?

本文解读一篇回答了这一问题的论文。

  • 标题:Early detection of NOx spikes in ferroalloy electric arc furnace plants
  • 期刊:Process Safety and Environmental Protection
  • 年份:2026
  • DOI:10.1016/j.psep.2025.108253

论文提出了一种方法,从电弧炉(Electric Arc Furnace, EAF)的运行数据和测量数据中,识别 NOx 骤增前的状态。模型是长短期记忆自编码器(Long Short-Term Memory Autoencoder, LSTM-AE)。该模型只学习正常运行数据。如果无法很好地重构新的输入,就将该时刻判定为预警。

本文使用的术语如下。

  • 骤增(spike):NOx 浓度超过由常规分布确定的上限的时刻。
  • 预警状态(early warning):紧挨在骤增之前的时刻。
  • 重构误差(reconstruction error):模型将输入压缩后再还原得到的值与原始输入之间的差值。该差值大,说明模型遇到了没见过的模式。

动机:超标的瞬间短暂而罕见,现有预测模型会漏掉

为什么要提前知道 NOx 骤增

论文给出的理由如下。

  • 电弧炉内温度可超过 1600 ◦C。在这一温度下,空气中的氮和氧发生反应,生成热力型 NOx。
  • 排入大气的 NOx 在阳光下会转化为细颗粒物和臭氧等二次污染物。这些物质会对呼吸系统和心血管疾病以及生态系统破坏产生影响。
  • 欧盟《工业排放指令》、韩国《大气环境保护法》和大气污染物总量管理制度都对 NOx 实行严格管控。
  • 电弧炉烟气在半干式反应器(Semi-Dry Reactor, SDR)中脱除硫氧化物,并经布袋除尘器过滤粉尘。然而 NOx 大部分未经处理就排向烟囱。
  • 当原料投入不规律、燃料组成和燃烧条件发生变化时,NOx 会短时间飙升。这种骤增在造成环境危害的同时,也带来经济损失。

专用的 NOx 减排设备——选择性催化还原(Selective Catalytic Reduction, SCR)——需要持续承担催化剂更换和氨喷射的费用。论文将提前检测视为与 SCR、选择性非催化还原(Selective Non-Catalytic Reduction, SNCR)配合使用的补充手段。其判断是,这有助于在控制成本的同时满足监管要求。

现有研究未涉及的部分

NOx 研究大多建立回归模型来预测排放浓度本身。在电弧炉方面,有研究先用卡尔曼滤波降噪,再用 LSTM 预测 NOx,并用 SHAP(Shapley Additive Explanations)找出主要变量。在火力发电和焚烧炉领域,也出现了不少经过变量选择、异常值剔除和平滑处理的预测模型。

这些模型有助于揭示 NOx 与运行变量之间的关系。但论文指出了以下不足。

  • 骤增在数据中占比极小,对模型训练几乎没有贡献。
  • 异常值剔除和平滑等预处理会把骤增本身抹掉。
  • 回归模型用均方根误差(RMSE)或决定系数(R2)等连续值预测指标来评估。这些指标只反映整体预测能力,并不单独评估提前捕捉罕见事件的能力。
  • 在造纸设备故障、蒸汽轮机、沙尘和城市燃气管道泄漏方面,已有预警研究。但直接研究电弧炉 NOx 骤增的却很少。
  • 电弧炉环境恶劣,传感器的安装和维护困难。要配备能捕捉骤增前细微变化的高性能传感器也很困难。

方法:只学习正常状态的模型,会对陌生模式发出预警

论文将方法分为四个步骤。第 1 步,确定与 NOx 相关性高的变量。第 2 步,用四分位距(Interquartile Range, IQR)定义骤增,给骤增前一时刻打上预警标签,然后划分数据。第 3 步,仅用正常数据训练 LSTM-AE,并通过精确率-召回率曲线确定预警阈值。第 4 步,若测试数据的重构误差超过阈值,则分类为预警,并用多种指标评估性能。

图 1. 该方法分四步:筛选变量、定义骤增并标注预警,仅用正常数据训练 LSTM-AE,再依据重构误差判定预警。

案例与数据

分析对象是韩国国内的铁合金生产现场。时间跨度为 2023 年 3 月 10 日至 12 月 31 日,共 297 天。数据来自三处,均为 5 分钟平均值。

  • 电弧炉:电极深度、用电量、冷却水流量、集尘管道温度等 8 个变量。
  • 烟气净化设备:SDR 入口和出口温度、布袋除尘器压力、引风机功率等 6 个变量。
  • 远程监测系统(Tele-Monitoring System, TMS):烟气中的 NOx、SOx、氧气、粉尘、温度、流量共 6 个变量。

变量总数为 8+6+6=20 个。原始数据共 58,965 条。

研究者因检修和临时停产,剔除了 7 月 15 日至 10 月 1 日的数据。NOx 连续缺失或为 0 超过 6 次的区间也被视为异常而剔除。剩余的缺失值用前后值相连的线性插值填补。最终保留 53,250 条,原始数据中约 10 % 被剔除。

第 1 步:确定与 NOx 共同变化的变量

  • 输入:20 个运行与测量变量的 5 分钟平均时间序列
  • 处理:计算皮尔逊相关系数,专家评审
  • 输出:输入模型的 7 个变量
  1. 计算每个变量与 NOx 的皮尔逊相关系数。
  2. 选出绝对值大于 0.30 的变量作为候选。
  3. 现场工程师、工艺管理人员和研究人员评审候选变量的物理合理性。

相关系数的取值在 −1 到 +1 之间。越接近 ±1,说明两个变量越呈线性关系共同变化;越接近 0,则关系越弱。0.30 沿用了将 0.30~0.70 视为中等相关的惯例。研究者没有追求捕捉全部非线性关系,而是选择直观地筛出便于专家快速评审的候选变量。

超过标准的变量有 6 个。

  • 烟气氧气:|r| ≈ 0.86
  • 烟气温度:|r| ≈ 0.57
  • 烟气 SOx:|r| ≈ 0.49
  • 用电量:|r| ≈ 0.37
  • 烟气粉尘:|r| ≈ 0.34
  • 电极深度:|r| ≈ 0.32

专家评审提出了以下意见。烟气温度升高会加快燃烧反应,使 NOx 增加。电力输入波动会引起电弧强度和温度波动,从而影响 NOx。电极深度反映炉内的运行条件。最终输入是再加上 NOx 自身的 7 个变量。

第 2 步:定义骤增,并给骤增前一时刻打上预警标签

  • 输入:53,250 条 NOx 时间序列
  • 处理:计算 IQR 上限,时间平移标注,按区段划分
  • 输出:正常与预警标签,以及训练、验证、测试数据
  1. 根据 NOx 的整体分布求出第一四分位数(Q1)和第三四分位数(Q3)。
  2. 上限(UB)按 Q3 + 1.5 × (Q3 − Q1) 计算,将超过上限的时刻标记为骤增。
  3. 给骤增紧前一时刻打上预警标签,骤增时刻本身从数据中剔除。
  4. 将数据分为 20 个区段,随机分配给训练、验证和测试。

IQR 方法不假定数据服从正态分布。因此适用于偏态的排放数据。该数据中的 NOx 平均值为 28.32 ppm,标准差为 17.60 ppm,范围为 0~458.95 ppm。Q1 为 16.36 ppm,Q3 为 38.66 ppm。IQR 为 38.66 − 16.36 = 22.30,上限按 38.66 + 1.5 × 22.30 计算,论文报告为 72.10 ppm。

超过该上限的数据占总量的 0.25 %。与正常数据的比例约为 400:1。骤增共 105 次。平均持续时间约 6 分钟,中位数为 5 分钟,最长为 25 分钟。

研究者还与”平均值加三倍标准差”的 3σ 方法做了比较。该方法的标准约为 81.12 ppm,大幅高于韩国国内 60 ppm 的监管标准。其判断是,IQR 上限更接近监管标准,适合作为现场标准。

标签采用时间平移(time-shifting)方式标注。例如,若骤增发生在时刻 t,平移长度为 2 步,则 t−2 和 t−1 为预警。1 步为 5 分钟。研究者测试了 14 步(520 分钟)。

平移长度不同,预警数据的数量也不同。按 1 步(5 分钟)计,正常数据为 53,116 条,预警数据为 106 条(0.20 %)。延长到 4 步(20 分钟),预警数据为 378 条(0.71 %)。无论取哪种长度,预警占比都不到 1 %。

划分方式也有其理由。铁合金工艺的产量和原料每天、每月都不同,预警会集中出现在特定时期。如果按时间顺序切分,测试区段中可能几乎没有预警。因此,在 20 个区段中随机分配 12 个用于训练、4 个用于验证、4 个用于测试。在代表性结果(随机种子 50)中,训练数据为 31,866 条,验证数据为 10,620 条,测试数据为 10,622 条。标注标签之后,用最小-最大归一化统一各变量的范围。

第 3 步:用正常数据训练 LSTM-AE 并确定阈值

  • 输入:训练和验证区段的正常数据(7 个变量)
  • 处理:训练 LSTM-AE,网格搜索,绘制精确率-召回率曲线
  • 输出:训练好的模型与预警阈值
  1. 编码器将短时间序列压缩为较小的向量。
  2. 解码器从该向量还原出原始时间序列。
  3. 调整权重,使均方误差变小。
  4. 用验证数据绘制精确率-召回率曲线,确定阈值。

均方误差是将原始值与还原值之差平方后取平均得到的值。只学习了正常模式的模型能很好地还原正常输入,误差较小。遇到没见过的模式时,误差就会变大。

模型结构如下。

  • 编码器:32 个单元的 LSTM 层,接着是 16 个单元的层,生成固定长度的向量。
  • 重复层:将该向量复制为与输入长度相同的份数。
  • 解码器:16 个单元的 LSTM 层,接着是 32 个单元的层。
  • 输出层:在每个时刻还原 7 个变量,使形状与输入一致。

网格搜索范围如下。输入长度 18,学习率 0.0010.01,迭代次数 30、60、100、200,批大小 32、64、128、256,早停耐心值 5、6、8。优化算法选用 Adam。

没有使用直接学习标签的分类模型,原因是数据不平衡。这类模型容易偏向多数类,从而漏掉罕见事件。研究者也考虑过 Transformer 和生成对抗网络(Generative Adversarial Network, GAN)。但 53,250 条数据对训练这类模型来说偏少,而且检测骤增更适合较短的输入,因此予以排除。

阈值定在验证数据的精确率曲线与召回率曲线相交的位置。在输入长度为 2、平移长度为 1 步的模型中,该值为 0.00595。重构误差超过 0.00595 即为预警,未超过则为正常。

第 4 步:测试数据分类与性能评估

  • 输入:测试数据和第 3 步的阈值
  • 处理:计算重构误差,生成混淆矩阵,计算指标
  • 输出:精确率、召回率、F1 分数、AUC、MCC
  1. 将测试数据输入模型,求出重构误差。
  2. 与阈值比较,分类为正常和预警。
  3. 与真实标签对照,统计真阳性、假阳性、真阴性、假阴性。
  4. 计算五个指标。

各指标的含义如下。

  • 精确率:发出的预警中,实际为预警的比例。
  • 召回率:实际预警中,被模型找出的比例。
  • F1 分数:精确率与召回率的调和平均数。按 2 × 精确率 × 召回率 ÷ (精确率 + 召回率) 计算。
  • AUC(Area Under the ROC Curve):改变阈值所绘制的受试者工作特征曲线下的面积。越接近 1,对两类的区分越好。
  • MCC(Matthews Correlation Coefficient):使用混淆矩阵全部四个值的指标,取值在 −1 到 +1 之间。常用于不平衡数据。

举一个计算示例。最终模型的精确率为 0.350,召回率为 0.212。F1 分数为 2 × 0.350 × 0.212 ÷ (0.350 + 0.212) = 0.1484 ÷ 0.562 = 0.264。研究者认为,在不平衡数据中只看精确率或召回率其中之一可能导致判断失误,因此将 F1 分数作为首要标准。

变体与场景

影响结果的设置有三项。

  • 平移长度:取得越长,预警数据越多(1 步 106 条,4 步 378 条)。在网格搜索的前五名模型中,有四个是 1 步(5 分钟)。
  • 阈值选择:以预防风险为先的现场可以侧重召回率,以工艺稳定为先的现场可以侧重精确率。也可以使用与监管标准一致的固定值。
  • 骤增标准的时间跨度:研究者基于整体分布确定了单一标准。按日、按月分别设定标准的方式留作后续课题。

结果:7 个变量与 LSTM-AE 的组合 F1 最高,为 0.264

图 2. 按各模型最佳平移长度比较,LSTM-AE 的 F1 分数最高,但与基准模型和简单阈值方式的差距不大。

平移长度与输入长度组合的比较

研究者按 F1 分数对网格搜索得到的模型进行了比较。第 1 名是平移长度 1 步、输入长度 2 步的组合。F1 分数为 0.264,AUC 为 0.768,MCC 为 0.271。第 2 名(输入 3 步)F1 为 0.259,第 3 名(输入 1 步)为 0.250。平移长度为 2 步的组合 F1 为 0.217,排第 5 名。

在这一数据中,平移 1 步、输入 2 步组合的 F1 最高。可能是因为骤增前 5 分钟的信号比前 10 分钟更明显。但这只是笔者的推测,并非论文所证实的内容。

比较如何确定输入变量

下面是改变输入变量构成后的比较。只输入 NOx 的模型 F1 为 0.217,AUC 为 0.622。输入全部变量的模型 F1 为 0.235,AUC 为 0.770。7 个变量的模型 F1 为 0.264,MCC 为 0.271,F1 和 MCC 最高。

以 F1 和 MCC 衡量,7 个变量的模型领先。AUC 方面,全部变量模型(0.770)与 7 个变量模型(0.768)相近。全部变量模型的 F1 高于只输入 NOx 的模型,但低于 7 个变量的模型。这一比较是基于该数据的一种划分得到的结果。

与其他模型的比较

将 LSTM-AE 与五个基准模型进行了比较。基准模型是 LSTM、AE(Autoencoder)、VAE(Variational Autoencoder)、DNN(Deep Neural Network)和 XGBoost。LSTM-AE 和 LSTM 以多个时刻作为输入,其余模型只接收单一时刻的 7 个变量。

核心数值如下。

  • LSTM-AE:精确率 0.350,召回率 0.212,F1 0.264。
  • LSTM:精确率 0.161,召回率 0.476,F1 0.241。
  • DNN:精确率 0.144,召回率 0.485。
  • VAE:AUC 0.782,F1 0.208。

LSTM-AE 的 F1 分数和 MCC(0.271)最高。LSTM 和 DNN 的召回率高,但精确率低,误报较多。AUC 以 VAE 最高,但在设定阈值下的 F1 却最低。以 F1 衡量,LSTM-AE 最高,但模型之间的差距不大。只输入单一时刻的 AE,其 F1(0.235)也与 LSTM(0.241)几乎相同。

与直接使用监管标准的方式比较

现场最容易想到的替代方案,是 NOx 超过某一数值就发出预警。研究者将标准在 40~70 ppm 之间变动,对这种方式进行了评估。

降低标准会提高召回率,但精确率下降。在平移 1 步下,若标准设为 40 ppm,召回率为 0.788,但精确率为 0.011,F1 仅为 0.021。在 60 ppm 时,精确率为 0.057,召回率为 0.364,F1 为 0.098。表中 F1 最高的组合是 4 步、60 ppm,为 0.206。

这种方式的 F1 分数最高也只有 0.21。超过监管标准并不意味着随后一定会出现骤增,因此会产生大量误报。

论文写道,LSTM-AE 的 F1 分数比这种方式高 6~9 %。论文没有明确这一数值是 %p 之差还是相对比例。从数值上看,与 F1 值的 %p 之差相符。以测试数据计,0.264 − 0.206 = 0.058,即约 6 %p 之差。将追加数据的 F1 0.30 与简单阈值方式中最高的 F1 0.21 比较,0.30 − 0.21 = 0.09,即 9 %p 之差。

稳定性、追加数据与计算负担

将随机种子改为 10、42、44、50 并重新划分数据,F1 和 MCC 的波动仍在 ±1.5 % 以内。在未用于训练的 2024 年 1 月 1~24 日数据上,精确率、召回率和 F1 分数均为 0.30。研究者据此判断模型没有过拟合。不过这只是同一现场 24 天的数据,要推广还需要更多验证。

模型的参数约为 16,871 个。在普通工作站上,单条推理平均耗时 20.6 ms,每秒约处理 48 条。由于 TMS 每 5 分钟保存一次数值,这一速度足以满足实时运行的需要。

F1 为 0.260.30 看起来偏低。研究者解释说,这是因为骤增前的时刻与正常状态非常相似,而且预警占比仅为 0.200.71 %。此前有研究用时间平移标签提前检测故障,报告的 F1 也只有 0.10。

意义与局限

有什么改变

  • 将 NOx 研究的问题从”浓度是多少”转变为”是否即将骤增”。
  • 将过去作为异常值剔除的骤增转而作为分析对象,并给紧前时刻打上标签。
  • 用 IQR 确定骤增标准,并与 3σ 方法和韩国国内监管标准比较,确认了其合理性。
  • 通过只学习正常数据的重构方式,处理了约 400:1 的不平衡。
  • 与五个基准模型和简单阈值方式进行了性能比较。

对从业者的价值

该模型基于以 5 分钟平均值采集的现有运行与测量数据运行。论文建议,可以将预警用于调整电力输入、电极深度和冷却水流量,以稳定炉况。这种调整的效果并未得到验证。对于配有 SCR 或 SNCR 的现场,可以根据预警实时调整氨喷射量。模型轻量,也便于接入现有控制系统。

对研究者的价值

时间平移标签与重构误差相结合的设计,可以迁移到水泥回转窑、焚烧炉、火力发电等排放偶尔骤增的其他高温工艺。用精确率-召回率曲线确定阈值的流程,以及比较分布标准与监管标准的流程,在其他污染物研究中也可直接使用。对于不平衡极端的问题,F1 为 0.26~0.30 处于什么水平,也可以从这篇论文中获得比较依据。

论文自述的局限

论文自己指出的局限有六点。

  • 数据时间跨度与范围:只使用了铁合金电弧炉的数据。要反映季节变化和工艺变化,需要更长时间跨度的数据,并且还需要在合金种类、炉运行和原料条件不同的工艺中进行验证。
  • 变量的滞后效应:工艺变量可能不会立即影响 NOx,但未能精细匹配滞后时间。
  • 模型结构:仅依赖 LSTM-AE 一种模型。数据积累后应测试 Transformer 或 GAN。
  • 测量间隔:5 分钟平均值无法完整反映快速燃烧反应的中间变化。还应测试 1 秒、30 秒、1 分钟的间隔。
  • 变量选择:皮尔逊相关只考察线性关系。需要能捕捉非线性关系的方法。
  • 固定阈值:骤增标准和预警阈值都固定为单一值。分时段标准和动态阈值是今后的课题。

笔者认为的应用条件

以下并非论文中的内容,而是笔者着眼于实际应用补充的条件。

  • 需要有能够承受误报的运行流程。精确率 0.350 意味着 100 次预警中只有约 35 次是实际预警(100 × 0.350 = 35)。对于其余 65 次(100 − 35),操作人员如何反应,需要事先确定。
  • 验证区段中需要有足够多的骤增案例。由于阈值是通过精确率-召回率曲线确定的,若验证数据中预警较少,阈值就会不稳定。
  • 实际运行是用过去的数据判断未来。与其直接期待随机区段划分得到的性能,不如再做一次按时间顺序划分的测试,这样更稳妥。
  • 原料或设备发生变化时,需要重新计算 IQR 上限和阈值。

马上可以做的事

可以用自己工厂的 TMS 数据,照着论文的流程做第一步。

  1. 从 5 分钟平均 NOx 数据中求出 Q1 和 Q3,按 Q3 + 1.5 × (Q3 − Q1) 计算上限。将该上限与自己厂区的监管标准并列比较。
  2. 统计超过上限的骤增的次数、平均持续时间和最长持续时间。确认在骤增前 1 步(5 分钟)打上预警标签时,其占总量的百分比是多少。
  3. 对每个运行变量求出与 NOx 的皮尔逊相关系数,筛出绝对值超过 0.30 的变量。与现场工程师一起评审这份清单,只保留在物理上说得通的变量。

关键词

相关文章