摘要
为解决传统单一模型在应对复杂水质预测等现实挑战时面临的局限性,提出模型简单平均法与两种Stacking集成策略,即基于最小二乘法(Least Square,LS)的加权集成、以极端随机森林回归(Extra Trees Regressor,ETR)为元学习器的Stacking集成。实地采集了某饮用水处理厂的全流程小时级监测数据,并对原始数据集进行了严格的预处理。在此基础上,在测试集上对所有单一模型和集成模型的预测性能进行综合评估与比较。结果表明,提出的3种集成模型在所有4项水质指标的预测上,其性能均显著优于任何单一模型,预测误差大幅降低。其中,LS加权模型在平均误差上表现最优,平均绝对百分比误差(MAPE)约为1.08%,ETR加权模型在平均误差略高0.02%。此外,探究了两种Stacking模型对基学习器的权重分配,结果表明,ETR加权模型具有较高的适应性。该模型在浊度骤增等高风险事件中,通过非线性的动态权重调整,能快速响应水质的复杂变化。本研究为饮用水处理的智能化管理提供了新视角,所提出的Stacking集成模型可为水厂的平稳运行与效率优化提供可靠的数据支撑,其强大的适应性则为工艺扰动和水质异常提供了关键的风险预警,有利于后续处理的及时调整。
Abstract
To address the limitations of traditional single models when dealing with complex water quality prediction and other real-world challenges, this study proposed the model simple averaging method and two Stacking integration strategies, namely the weighted integration based on the Least Square (LS) method and the Stacking integration with the Extra Trees Regressor (ETR) as the meta-learner. The full-process hourly monitoring data of a certain drinking water treatment plant were collected on-site, and the original data set was subjected to strict preprocessing. On this basis, the predictive performance of all individual models and ensemble models was comprehensively evaluated and compared on the test set. Results indicate that the three proposed ensemble models consistently outperform all single models across all four water quality indicators. Notably, these models achieve a substantial reduction in prediction error. Among these, the LS-weighted model performs the best in terms of average error, with an MAPE value of approximately 1.08%, while the ETR-weighted model has an average error that is slightly higher by 0.02%. Furthermore, this study investigates the weight allocation of base learners in the two Stacking models, revealing that the ETR-weighted model demonstrates greater adaptability. Specifically, this model demonstrates the ability to respond rapidly to complex water quality variations through nonlinearly dynamic weight adjustment, particularly during high-risk events such as sudden turbidity spikes. This study provides a new perspective for the intelligent management of drinking water treatment. The proposed Stacking ensemble model can provide reliable data support for the stable operation and efficiency optimization of water treatment plants. Its strong adaptability offers crucial risk warnings for process disturbances and water quality anomalies, facilitating timely adjustments in subsequent treatment processes.
饮用水安全保障是关键的民生问题。如果饮用水质量不达标,水中的微生物、有害物质会引发多种疾病,严重危害居民健康[1]。由于一些企业违法排污和相关部门监管不到位,部分水污染事件未能及时被发现并处理,造成了较大的社会负面影响[2]。同时,大暴雨等极端天气频发加剧了污染物扩散速度和范围,增加了水质监测与管理的难度[3]。通过对水质变化趋势的分析,能够提前预见潜在的水污染风险,从而有效预防和减少水污染事件的发生,对保障饮用水安全具有重要意义[4]。
饮用水处理相关研究主要包括实验模拟、机理模型、数据驱动方法。实验模拟、机理模型这些传统方法通常依赖于一定的理想条件,需要简化现实情况,以便在可控的实验环境中进行测试和分析[5-7]。上述方法难以同时考虑水体本身的特性以及污染源的动态变化,忽略了饮用水实际处理过程中多种因素共同影响的复杂性[8]。另一方面,这些传统方法往往依赖高频人工采样与实验操作,难以满足水质实时监测的需求[9]。随着物联网、人工智能和大数据技术的不断进步,数据驱动的饮用水水质预测技术已成为当前的研究热点,推动了饮用水处理领域的可持续发展[10-11]。当前,该领域引入了多种数据驱动模型,从随机森林、SVM等传统机器学习模型,到循环神经网络(RNN)、卷积神经网络(CNN)、长短期记忆网络(LSTM)、Transformer等深度学习模型。研究表明,线性回归(Linear Regression,LR)模型在饮用水处理方面展现出了良好的整体性能[12]。为捕捉复杂的非线性关系,以梯度提升模型为代表的集成学习模型亦被广泛应用。这类模型通过不断迭代来生成一系列弱学习器(决策树)并将其集成为强预测模型,在饮用水处理的相关问题中取得了较好的效果[13]。近年来,随着深度学习技术的发展,针对时序数据设计的专用架构为该领域带来了新的突破。其中,时间卷积网络(Temporal Convolutional Networks,TCN)、时间融合转换器(Temporal Fusion Transformer,TFT)等模型,因其在捕捉长期依赖和处理多变量输入方面的优势,正成为水质预测研究的前沿方向[14]。由此可知,数据驱动方法能够从海量数据中学习到复杂非线性关系,有助于解决饮用水处理领域中的重大挑战,正成为保障饮水安全、实现智慧水务的关键技术[15]。
在饮用水处理领域,尽管数据驱动方法已展现出较大潜力,但目前研究多集中于训练和优化单一模型。这种策略在应对复杂多变的饮用水处理场景时,很难同时关注不同水质指标的变化趋势。如LSTM模型更擅长捕捉长期依赖关系,可能对浊度的瞬时突变不够敏感;基于树的机器学习模型通过划分已知数据空间进行预测,难以充分学习高锰酸盐指数的趋势性、周期性规律[16]。此外,饮用水源水质在大部分时间是稳定的,但偶尔会因突发事件导致水质在短期内急剧恶化。然而,单一模型在训练时更倾向于拟合常规状态,对罕见但至关重要的异常事件并不敏感,甚至可能将其视为噪声,以至于在关键时刻无法做出及时且准确的响应[17-18]。
集成学习为解决上述问题提供了有效途径,在水文领域有很好的应用前景[19]。饮用水处理不仅要求在稳态下精准预测,更要求在面临原水水质突变、药剂投加反应滞后等异常情况时,模型能够提供迅速且可靠的反馈,指导工艺立即响应,确保水质满足国家卫生标准,保障民生安全[20]。传统的数据驱动模型往往侧重于提升整体统计精度,容易在极端的突变点产生平滑效应或响应滞后,难以兼顾对稳定状态的精准拟合与对异常状态的快速响应。集成学习通过构建并结合多种个体学习器,以提高单一模型的准确性和鲁棒性,并增强对不同类型数据、不同应用问题的适应能力,实现更可靠的预测[21]。因此,本研究针对饮用水处理领域提出了创新性的集成学习方法,为解决传统单一模型在应对复杂水质预测等现实挑战时所面临的局限性,提供了强有力的方案。
1 研究方法
1.1 基于时间序列的机器学习模型
为了捕捉水质本身的时序依赖性和化学药剂投加等人工干预带来的动态影响,选取了6种具有代表性的机器学习模型作为基学习器,实现了多水质指标的时间序列预测任务:以LR模型作为捕捉水质线性变化的基准模型;选取XGBoost、LightGBM、CatBoost 3种梯度提升决策树变体,利用其在树生长策略与噪声处理机制上的内在差异,提供多样化的预测视角;引入TCN和TFT两种深度学习模型,以弥补传统机器学习模型在捕捉长期时序依赖方面的不足。
进一步地,针对饮用水的水质预测,构建了基于多变量的时间序列预测框架,如图1所示。为实现这一目标,采用了滑动窗口方法,将原始时间序列数据转化为适用于监督学习的输入输出对。通过设定一个固定大小的窗口,在时间序列数据上以一个时间步为单位进行滑动。窗口内的数据被划分为用于模型输入的历史观测序列和用于模型预测的目标序列。模型输入变量包括进水水质指标(水温、浊度等)、药剂投加量(预臭氧投加量、加矾量等)。模型的输出是多个关键出水水质指标(出水pH、浊度等)。由于本研究关注的是从原水进厂、经多单元处理至出水的全尺度饮用水处理过程,模型的输入时间窗需覆盖一次完整的水力循环和化学药剂的反应过程,以更全面地体现水质变化的时间滞后特征。研究证明,在相似的时序建模场景中,12 h的输入窗口有助于捕捉进出水水质与投药之间的延迟关联[13]。因此,结合水厂运行特性与相关研究结论,采用12 h作为输入步长,即利用过去12 h的历史数据进行学习。输出步长设为1 h,用于预测未来1 h的出水水质指标。
图1时间序列预测框架
Fig.1Time series forecasting framework
1.2 集成学习的模型组合策略
为了进一步提升预测模型的精确度与泛化能力,采用了3种集成学习策略,即模型简单平均法、基于最小二乘法(Least Square,LS)的加权集成、以极端随机森林回归(Extra Trees Regressor,ETR)模型为元学习器的Stacking集成。其中,模型简单平均法作为基准集成方法,用于验证LS加权与ETR优化加权策略的性能提升。本研究通过训练多个基学习器,并通过不同集成学习策略来整合这些基学习器的预测结果,从而获得比任何单一模型更优越的性能。
具体地,模型简单平均法是对k个基学习器的输出进行算术平均,最终预测值可表示为
(1)
LS优化加权和ETR模型优化加权都属于Stacking集成学习模型。但LS优化加权采用的是一种线性的组合方式,通过优化每个基学习器的权重来最小化集成模型的误差,即
(2)
通过最小化损失函数L(ω)得到一组全局最优的固定权重ωi,使得基学习器的加权预测尽可能地接近真实值yj。
(3)
式中:yj为第j个样本的真实值,为第i个基学习器对第j个样本的预测值。相比ETR模型,优化加权能够学习基模型预测之间的非线性关系。将k个基学习器的预测向量 作为输入,传递到训练好的ETR模型中,通过构建大量决策树来学习非线性函数,即
(4)
在构建的大量决策树中,向量会在森林中的每一棵树里,根据树内部的分裂规则一路向下,最终落入一个叶节点。在每个节点分裂时,算法会随机选择一个数量为k的特征子集。对于这个子集中的每一个特征,随机生成一个分裂点,并从中选择最优的那一个作为该节点的分裂规则。每个叶节点都包含一个预测值,该值是训练过程中落入该叶节点的所有样本的目标均值。最终,集成学习模型将所有树的预测值求平均得到输出结果。通过构建大量高度随机化的决策树,模型能够高效处理高度相关的特征,降低模型对某一组特定基学习器预测的依赖,使得组合更加稳健有效。
由于饮用水水质数据随着时间的变化会有不同的波动规律,同时,药剂投加策略受气候等外界因素的变化而不断调整,从而出现了“数据漂移”现象。这意味着静态的集成学习模型在训练阶段学习到的规律,在未来某个时间点可能不再适用。因此,提出了一种动态的加权集成学习策略,通过每24 h一次的滚动更新机制对模型重新训练,从而确保模型能够持续学习并适应新的数据模式。
选取了6种机器学习模型作为基学习器,包括LR、XGBoost、LightGBM、CatBoost、TCN、TFT。在处理多输出的时间序列预测问题时,为了充分利用每个模型的优势,设计了一种基于平均绝对百分比误差(MAPE)的基学习器筛选策略。该策略依据各基学习器在每一个出水水质指标上的预测表现,剔除表现最差(MAPE最大)的模型,将筛选后的基学习器分别应用到3种模型组合策略,构建并评估最终的集成预测模型,预测框架如图2所示。
图2集成学习模型预测框架
Fig.2Prediction framework for ensemble learning models
1.3 贝叶斯超参数优化
为了确保每个机器学习模型能够达到最佳预测性能,采用贝叶斯超参数优化算法来确定最优参数组合。贝叶斯优化是一种高效的全局优化策略,其通过构建一个关于目标函数的概率代理模型,并利用采集函数选择下一个最有潜力的超参数组合进行评估[22]。与传统的网格搜索和随机搜索相比,这种方法能够以更少的迭代次数找到全局最优解。本研究采用Optuna超参数优化框架来实现这一过程。为每个机器学习模型定义了超参数搜索空间,如表1所示。在持续计算优化后,最终为每个模型确定了最优超参数组合,为后续的模型训练与评估奠定了基础。
1.4 模型评价指标
为了全面反映模型在不同角度的预测性能,采用了平均绝对百分比误差(MAPE,EMAP)、平均绝对误差(MAE,EMA)、均方根误差(RMSE,ERMS)3种指标,描述机器学习模型和集成模型的预测结果。这些评价指标既量化了绝对误差,又反映了相对误差,还能对异常值的惩罚效应来评估模型的稳健性,其评价指标的计算方式为
(5)
(6)
(7)
式中:n为样本量,yi为样本真实值,为样本预测值。
1.5 模型可解释性分析
SHAP是一种基于博弈论的方法,通过计算每个特征对预测结果的贡献度来解释模型[23]。在本研究中,ETR模型的输入特征是所有基学习器的预测值。通过SHAP可解释分析方法,深入分析不同基学习器的预测结果对ETR元学习器的贡献程度,以阐述ETR元学习器在不同进水水质和药剂投加下所采用的动态组合策略。由于ETR模型是一种基于决策树的模型,采用TreeExplainer为测试集的每个样本计算了各基学习器的SHAP值。为了评估每个基学习器在决策中的影响程度,对SHAP值取绝对值,并在每一个样本上进行归一化处理。先是计算该样本内所有基学习器的SHAP绝对值的总和,再将每个基学习器的SHAP绝对值分别除以总和,最终得到了每个样本下各基学习器的相对贡献占比,其表达式为
(8)
式中:Pi,j为第j个基学习器在第i个样本上的相对贡献占比,φi,j为第j个基学习器在第i个样本上计算得到的SHAP值,M为基学习器的总数量。
表1机器学习模型超参数搜索空间
Tab.1Hyperparameter search space for machine learning models
2 模型结果与分析
2.1 数据收集与处理
选取江苏省某饮用水处理厂2022年10月11日—2023年9月30日(355 d)的处理过程数据,包括6种进水水质指标(水温、浊度、pH、高锰酸盐指数、溶解氧、藻密度)、4种投加药剂(预臭氧投加量、加矾量、后臭氧投加量、后加氯量)和4种出水水质指标(pH、浊度、余氯、高锰酸盐指数)。构建了1 h采样频率的时间序列数据集,用于训练机器学习模型。
对原始数据进行了预处理,包括异常值剔除、空缺值填补和数据归一化。由于仪器故障等意外事故的出现,数据集会存在数据缺失、异常情况。结合专家经验判断,筛选并剔除了异常值,通过线性插值对所有空缺值进行填充,最终得到8 520组数据。数据集按时间顺序以6∶2∶2划分为训练集、验证集和测试集。
2.2 基学习器预测表现
利用Darts库构建了LR、XGBoost、LightGBM、CatBoost、TCN、TFT6种时间序列预测模型,并采用Optuna框架进行超参数优化。图3展示了6种基学习器在训练集、验证集、测试集上对4种出水水质指标的预测结果。实验结果表明,不同模型在预测不同出水水质指标时表现出显著差异。pH在验证集中呈现出长期平稳、偶发突变的特性。LR模型能够很好地拟合pH 7.0~7.5的平稳数据,从而获得较低的整体平均误差,MAPE值约为0.16%。而在测试集上,出水pH呈现出连续、高频的数据波动。TCN模型通过平滑处理使其预测点离真实值的平均距离最近,获得了最小的MAPE值(约0.05%)和MAE值(约0.004),精度远高于其他模型。由于在5月—7月出现季节性原水水质恶化问题,出水浊度在验证集中呈现持续的非线性上升。此时,TCN模型的预测曲线与真实值的贴合度最高,LR模型和TFT模型在出水浊度预测中也表现较好。在测试集中,LR模型的MAPE值略低于TCN模型,MAE值和RMSE值则相差不大。出水余氯质量浓度在验证集上长期稳定维持在0.75 mg/L附近,后面进入了更高的稳态区间。 TCN模型因其强大的模式识别和噪声过滤能力,获得了最低的平均误差,MAPE值约为2.79%。但在测试集中,余氯开始出现了持续、高频的剧烈波动,这更契合梯度提升模型的优势,XGBoost模型、CatBoost模型、LightGBM模型在评价结果上均表现较好。TFT模型在预测出水余氯上表现最差,MAPE、MAE、RMSE值远高于其他模型。对于高锰酸盐指数的预测,LR模型虽然在验证数据上评价指标表现优异,但其线性假设导致模型难以捕捉数据中的非线性动态。而TCN模型体现了较好的泛化能力,在测试集上表现出显著优势,MAE约为0.010 2,RMSE约为0.014。
图36种机器学习模型在验证集和测试集的评价结果对比
Fig.3Comparison of evaluation results of six machine learning models on validation and test sets
总体来看,TCN模型在预测出水pH、高锰酸盐指数上明显优于其他预测模型。在预测出水浊度方面,TCN模型和LR模型均表现出色。XGBoost、LightGBM、CatBoost这3种梯度提升模型更适合预测出水余氯,其预测表现都很好。根据表2中各基学习器的MAPE评价结果,对集成模型的基学习器组合进行了优化筛选,结果如下:在pH预测中剔除LR模型;在浊度预测中剔除CatBoost模型;在余氯和高锰酸盐指数预测中均剔除TFT模型。经筛选保留的基学习器被应用于3种集成策略的构建。
2.3 集成学习模型优化结果
为了更好地融合多模型在预测不同出水水质指标的优势,根据模型在验证集上的预测表现,对每个出水水质指标剔除了表现最差的预测模型。最终构建了3种集成模型。表2展示的是6种单一模型和3种集成模型在测试集上预测4种出水水质指标的MAPE值。可以看出,作为基准的简单平均集成法在预测出水水质指标中展现出了较优的预测性能,所提出的两种Stacking集成学习模型在预测表现上更具优势。
表2单个模型与集成模型在测试集上的预测性能对比(MAPE)
Tab.2Prediction performance comparison of individual and ensemble models on test set (MAPE)
图4展示了6种基学习器和3种集成模型在测试集上对4种出水水质指标的预测结果以及模型的局部预测表现。图4(a)中展示了出水pH能够在短时间内发生剧烈变化。这是因为pH与若干小时前的药量、进水pH存在复杂、非线性的响应关系。TCN模型、TFT模型等单一模型在预测pH波动较大的区域(在7月24日和7月27日附近)时,预测曲线相对平滑,且波动表现出一定程度的延迟,而集成模型预测pH时能够及时响应,与真实值的偏差较小。这表明集成模型不仅学到了数据的整体趋势,还能利用不同基学习器的优势捕捉到数据的动态细节,在预测pH上表现更好。图4(b)中展示了出水浊度在9月3日末突然骤增,并在9月9日初突然骤减,LR模型、LightGBM模型、TCN模型的预测曲线几乎没有延迟。这使得LS加权模型和ETR非线性加权模型在预测浊度时均表现出色,这两种Stacking集成模型在感知到数据发生突变时能够提供预测效果较好的基模型组合。一些基学习器(如TFT模型、CatBoost模型)在浊度突变的情况下预测效果很差,会明显拉低简单加权集成模型的最终预测结果。从图4(c)可以看出,TFT模型在预测余氯中多个极端值的情况下,严重偏离真实值,而集成模型表现得非常稳健。在预测高锰酸盐指数时,图4(d)的局部预测表现证明了集成模型不仅能处理随机波动,还可以更精确地预测非线性趋势,尤其是非线性Stacking模型。作为元学习器,ETR模型能够更好地找到基学习器的最优组合,其预测效果比其他单一模型更加稳定和精确。
为揭示两种Stacking模型的性能差异,对其基学习器的动态权重分配进行了深入分析。如图5、6所示,测试集样本中基学习器的权重占比变化是根据窗口的滑动顺序展示的,横坐标代表每个窗口内输入序列的起始时间。从图5可以看出,LS加权模型计算出的权重变化幅度较小,且依赖于最优基学习器。如在pH的预测中,LightGBM模型在绝大多数时间内权重占比超过了90%(图5(a));在预测余氯(图5(c))和高锰酸盐指数(图5(d))时,最优基学习器(分别是XGBoost和LR模型)权重均占比过半。在实际运行过程中,原水水质和加药策略是不断变化的,这种线性加权可能无法适应进水水质突变或工艺参数调整带来的动态影响。相反,ETR模型具有非线性动态优势,该模型会根据当前的运行状态,在每一个时间步下动态调整各基学习器的贡献权重。
图6展现了ETR模型中各基学习器的SHAP贡献占比结果。这种动态优势在应对浊度突变时尤为明显,如图6(b)所示。在9月3日浊度突然变高后, LightGBM模型在该运行状态下表现不佳,其贡献占比下降了26%左右。与此同时,在这种高浊度的情况下,XGBoost模型的预测能力更可靠,因此,将该基学习器的权重提升了20%左右。当浊度在9月9日突然变低时,LightGBM模型的贡献占比回升到接近32%,以更好地捕捉浊度下降的趋势。
图44种出水水质指标的预测值与实际值对比(测试集)
Fig.4Comparison of predicted and actual values for four effluent quality indicators (test set)
整体来看,Stacking集成模型能够根据进水水质变化趋势和药剂投加策略,更好地模拟不同工艺条件下饮用水处理过程,为水厂的精细化运行和智能化管理提供关键支撑。通过对出水水质的精准预测,辅助水厂人员优化药剂投加量,降低运行成本并提高运营效率。相比LS加权模型,ETR非线性加权模型具备更强的自适应能力。虽然其在平均误差上高于LS加权模型,但其动态适应性能更好地捕捉到高风险事件引起的水质突变,展现了更强的鲁棒性。ETR非线性加权模型能快速响应水质的复杂变化,为规避水质风险提供关键预警,从而增强供水安全保障。
图5最小二乘法加权集成模型的基学习器组合优化结果
Fig.5Optimized combination results of base learners for LS-weighted ensemble models
图6ETR非线性加权模型中各基学习器的SHAP贡献占比
Fig.6SHAP-based contribution share of base learners in ETR nonlinear weighted models
3 结论
1)构建的6种机器学习模型在预测不同出水水质指标时表现出了显著的性能差异。通过贝叶斯优化对模型超参数寻优后,各模型的预测优势得以凸显:TCN模型在pH、高锰酸盐指数预测上表现最佳;LR模型在预测浊度上误差最小;而以XGBoost模型、LightGBM模型、CatBoost模型为代表的梯度提升模型更适用于余氯的精准预测。
2)提出的3种集成模型(模型简单平均法、LS优化加权、ETR优化加权)的预测精度均优于单一模型。与基准模型(模型简单平均法)相比,这两种Stacking集成模型提升了预测稳定性。通过训练元学习器来学习最优的组合策略,并每24 h后对模型重新训练,确保模型能持续适应水质变化,从而实现更稳定的长期预测。
3)深入探究了两种Stacking元学习器在应对不同工艺条件时的动态优化差异。LS加权模型展现了全局稳定性,其倾向于在饮用水处理的平稳运行期找到最优解,获得了较优的全局平均指标(MAPE约为1.08%)。ETR加权模型则展现了动态适应性。在面对浊度骤增等高风险事件中,ETR模型通过动态权重调整,精准捕捉到实际水质变化,表现出强大的鲁棒性和快速响应的能力。在饮用水处理领域,这种在关键时刻能够提供可靠预警的模型,其价值远超全局平均误差上0.02%的微小差异。
4)对于饮用水处理领域,改进后的集成模型凭借高精度、高稳定性与高适应性,为饮用水处理厂的智能化管理提供了坚实的技术基础,对保障供水安全和优化工艺提供了重要实践价值。为进一步提升模型的可信度,未来研究应将领域先验知识与数据驱动模型相结合,以增强其可解释性与泛化能力。

