改进GOOSE-SVM的土壤有机质质量分数反演研究
doi: 10.11918/202510106
徐鸣谦1,2 , 张枫1,2 , 叶雪松1,2 , 冯威1,2 , 董双石1,2 , 赵振豪1,2
1. 地下水资源与环境教育部重点实验室(吉林大学),长春 130021
2. 吉林省水资源与水环境重点实验室(吉林大学),长春 130021
基金项目: 国家自然科学基金(5240100851) ; 北大荒黑土地土壤有机质提升技术研究集成与应用(BDHYJY-YJ-02-I-2023-1211048)
Study on inversion of soil organic matter mass fraction based on improved GOOSE-SVM
XU Mingqian1,2 , ZHANG Feng1,2 , YE Xuesong1,2 , FENG Wei1,2 , DONG Shuangshi1,2 , ZHAO Zhenhao1,2
1. Key Laboratory of Groundwater Resources and Environment(Jilin University),Ministry of Education, Changchun 130021 , China
2. Jilin Provincial Key Laboratory of Water Resources and Environment (Jilin University), Changchun 130021 , China
摘要
为解决土壤有机质(SOM)高维非线性光谱反演中模型易陷入局部最优、精度不足的问题,提出一种基于改进鹅群优化算法(IGOOSE)优化支持向量机(SVM)的土壤有机质反演方法。以黑龙江典型农场区域土壤样本为研究对象,采用马氏距离法剔除异常样本,并基于偏最小二乘回归(PLSR)建模结果筛选最优光谱预处理方法;通过构建最优预处理条件下全波段SVM、随机森林(RF)与极限学习机(ELM)模型,确定最优基础反演模型;进一步采用连续投影算法(SPA)、随机青蛙特征重要性筛选(RFROG)和竞争自适应重加权采样(CARS)进行光谱特征降维,选取最优降维方法所得特征作为模型输入。在模型参数优化过程中,通过动态调整种群规模,并融合Lévy飞行策略、随机扰动机制及混合邻域搜索方法,对基础鹅群优化算法(GOOSE)进行三阶段自适应改进,构建IGOOSE算法。经标准测试函数验证其有效性后,将IGOOSE用于SVM参数优化,并与原始GOOSE算法进行对比,以辨识性能更优的土壤有机质反演模型。结果表明:一阶导数(D1)预处理后构建的PLSR模型精度显著优于其他预处理方法;基于全波段D1数据构建的最优基础模型为SVM,其五折交叉验证平均决定系数(R2)达0.7624;CARS为最优光谱特征降维方法,基于其所选特征构建的CARS-SVM模型五折交叉验证平均R2为0.7537;IGOOSE-SVM泛化能力与预测稳定性方面均显著优于GOOSE-SVM,训练集与测试集R2分别提升0.1066与0.0411,均方根误差(RMSE)分别降低2.5413 g/kg与0.5287 g/kg,最终训练集与测试集R2分别达到0.9252与0.8416,RMSE分别为4.4189 g/kg与7.0407 g/kg。研究表明,所提出的改进策略有效缓解了高维非线性光谱数据导致的建模困难,IGOOSE-SVM模型为实现土壤有机质的高精度反演提供了可靠途径,并为优化算法在光谱建模领域的应用与改进提供了理论依据。
Abstract
To address the problems that models easily fall into local optima and have insufficient accuracy in the high-dimensional nonlinear spectral inversion of soil organic matter (SOM), this paper proposed an inversion method of SOM based on a Support Vector Machine (SVM) optimized by an improved goose swarm optimization (IGOOSE) algorithm. Taking soil samples from typical farm areas in Heilongjiang Province as the research object, this paper used the Mahalanobis distance method to remove abnormal samples and screened the optimal spectral preprocessing method based on partial least squares regression (PLSR) modeling results; by constructing full-band SVM, random forest (RF), and extreme learning machine (ELM) models under the optimal preprocessing condition, this paper determined the optimal basic inversion model; furthermore, this paper used the successive projection algorithm (SPA), random frog feature importance selection (RFROG), and competitive adaptive reweighted sampling (CARS) to conduct spectral feature dimensionality reduction and selected the features obtained by the optimal dimensionality reduction method as the model input. In the process of model parameter optimization, by dynamically adjusting the population size and integrating the Lévy flight strategy, random perturbation mechanism, and hybrid neighborhood search method, this paper conducted a three-stage adaptive improvement on the basic goose swarm optimization (GOOSE) algorithm to construct the IGOOSE algorithm. After verifying its effectiveness via standard test functions, this paper applied IGOOSE to SVM parameter optimization and compared it with the original GOOSE algorithm to identify the inversion model of SOM with better performance. The results show that the accuracy of the PLSR model constructed after first derivative (D1) preprocessing is significantly superior to other preprocessing methods; the optimal basic model constructed based on full-band D1 data is SVM, and its five-fold cross-validation average coefficient of determination (R2) reaches 0.7624; CARS is the optimal spectral feature dimensionality reduction method, and the five-fold cross-validation average R2 of the CARS-SVM model constructed based on its selected features is 0.7537; IGOOSE-SVM is significantly superior to GOOSE-SVM in terms of generalization ability and prediction stability, and the R2 of the training set and test set increase by 0.1066 and 0.0411, respectively, while the root mean square error (RMSE) decreases by 2.5413 g/kg and 0.5287 g/kg, respectively. Finally, the R2 of the training set and test set reach 0.9252 and 0.8416, respectively, and the RMSE is 4.4189 g/kg and 7.0407 g/kg, respectively. The research indicates that the proposed improvement strategy effectively mitigates the modeling difficulties caused by high-dimensional nonlinear spectral data. The IGOOSE-SVM model provides a reliable approach for achieving high-precision inversion of SOM and provides a theoretical basis for the application and improvement of optimization algorithms in the field of spectral modeling.
有机质质量分数是土壤肥力的核心指标[1],黑土作为典型的土壤类型,其有机质质量分数的精准监测对指导农业生产和推进土壤保育具有重要意义。北大荒农场作为东北重要的产粮基地,长期高强度耕作致使黑土层变薄、土壤有机质质量分数快速衰减[2]。目前,黑土层厚度减少了30%~50%,部分区域有机质质量分数下降超50%,黑土退化问题正严重威胁区域生态安全与粮食可持续生产[3]。因此,科学、高效地评估黑土有机质状况,已成为黑土资源保护与精准管理的关键前提。
传统的土壤有机质检测主要依赖实验室化学分析方法,过程繁琐、周期长,且难以获取土壤属性的空间连续信息[4]。相比之下,高光谱遥感技术具备波段连续、信息密集的特点,可实现土壤理化性质的快速、无损检测,在土壤属性反演中展现出显著优势[5]。随着机器学习技术的广泛应用,土壤有机质质量分数的反演精度得到明显提升。然而,黑土区有机质组分复杂,受气候与耕作条件等因素影响显著[6],其光谱响应呈现强异质性和高维非线性特征,对反演模型的适应性与鲁棒性提出了更高要求[7]。在此背景下,模型参数的智能优化成为提升黑土有机质反演精度的关键环节。
参数优化常借助元启发式算法实现,然而,现有典型算法受限于自身机制,在复杂优化问题中仍存在明显不足。如粒子群算法(PSO)常因惯性权重设置不当而陷入局部最优;灰狼优化算法(GWO)在处理复杂问题时易出现早熟收敛。尽管近年来各类新兴智能算法不断涌现且各具优势,但在应对高维、强非线性光谱数据建模时,仍普遍存在种群多样性退化、收敛精度不足等问题。2024年,Hamad等[8]提出的鹅群优化算法(GOOSE)是一种新兴的元启发式算法,算法模拟了鹅群休息时守卫鹅单腿站立并抓握石子的协同警戒机制,即石子掉落的声音可惊醒守卫,从而及时唤醒群体应对潜在威胁。该算法通过建立石子掉落时间与声音传播距离的数学模型,自适应调整搜索步长与范围,有效平衡全局探索与局部开采能力,在基准测试与工程优化中表现出收敛快、精度高的优势[9]。然而,在面对高维复杂的土壤光谱建模场景时,GOOSE算法在鲁棒性与收敛精度方面仍存在不足,有待进一步改进[10]
针对上述问题,以黑龙江省宝泉岭与友谊农场的典型黑土样本为研究对象,提出一种基于改进鹅群优化算法(IGOOSE)的土壤有机质高精度反演模型。系统对比多种光谱预处理方法与特征选择算法,确定最优数据处理流程;在此基础上,重点对GOOSE算法进行三阶段自适应改进,包括强化全局探索机制、调整动态种群策略等,以提升其在高维光谱数据中的优化性能与稳定性,提高黑土有机质反演模型精度。本研究旨在探索自适应优化机制在黑土区土壤有机质高光谱反演中的适用性,通过构建一种鲁棒性强、精度高的参数优化框架,为黑土肥力监测与土壤资源可持续管理提供可靠方法支撑。
1 材料与方法
1.1 数据采集
本次实验的土壤样本采集自黑龙江友谊农场和宝泉岭农场,采样时间为2024年10月,在两个农场内依据不同地形与作物种植类型,采用随机采样结合网格化布点的方式,共采集387份土壤样本。其中,友谊农场采集89份,宝泉岭农场采集298份。采样过程中,去除表层杂物后,使用不锈钢采样铲采集表层土壤,每个采样点将5个子样本充分混合为一份样品。剔除含大量砂砾、动植物残体等异常土壤后,每份样品留存(200±2)g,密封并详细标注信息。为减少环境因素对样本的影响,将土壤样品置于实验室恒温恒湿环境(温度25℃±2℃,湿度40%~60%)静置48 h,待其理化性质稳定后,采用重铬酸钾氧化法精准测定土壤有机质质量分数,同步开展高光谱数据采集,采用美国ASD公司生产的FieldSpec 4光谱仪,测量波长为350~2 500 nm,分辨率为3 nm。取静置后的土壤样品(200±2)g,均匀填充至仪器配套的圆柱形样品槽(直径8 cm,深度5 cm),轻压使表面平整且无空隙,覆盖定制标准白板以消除边缘漏光和环境光干扰,将样品槽置于仪器载物台中心位置。每个样品扫描10次后取平均光谱作为有效数据。
1.2 数据预处理
1.2.1 异常值剔除
在数据采集过程中,人为或设备等因素引入的误差可能导致异常值的出现[11],从而降低数据质量。为此,采用马氏距离算法(Mahalanobis Distance Algorithm)[12]对异常样本进行识别与剔除,并在后续步骤中实施光谱数据的变换处理。
1.2.2 光谱数据变换
针对原始光谱中存在的杂散光、仪器噪声与基线漂移等问题,采用标准正态变量变换(Standard Normal Variate,SNV)、多元散射校正(Multiplicative Scatter Correction,MSC)、SG平滑(Savitzky-Golay Filter,SG)、一阶导数(First-order Derivative,D1)和二阶导数(Second-order Derivative,D2)[13]进行光谱数据变换,并通过构建偏最小二乘回归(PLSR)模型比较筛选出最佳方法。
1.3 特征筛选
为提升模型运算效率与泛化能力,减少光谱数据中冗余信息的干扰,采用3种特征选择方法进行数据降维处理,包括竞争性自适应重加权采样(Competitive Adaptive Reweighted Sampling,CARS)[14]、随机蛙跳(Random Frog,RFROG)[15]与连续投影算法(Successive Projections Algorithm,SPA),以系统比较不同特征维度对建模效果的影响。SPA与RFROG倾向于筛选判别力最强的特征子集,适用于模型简化与解释性要求较高的场景;CARS则通过模拟变量间竞争机制保留更多潜在有效信息,更适用于对预测精度要求较高的复杂建模任务。
1.4 模型构建
采用支持向量机(Support Vector Machine,SVM)[16]、随机森林(Random Forest,RF)[17]与极限学习机(Extreme Learning Machine,ELM)[18]作为对比模型。这3种模型在处理高维土壤光谱数据方面优势互补,SVM在小样本情况下具有坚实的理论保证和优异的泛化能力;RF以其卓越的稳定性和对高维特征的天然处理能力著称;ELM则以其极致的训练速度和强大的全局搜索能力见长。通过与这些性能强劲且各具特色的基准模型进行系统对比,能够深入揭示不同模型在处理土壤高光谱数据时的性能特质,从而为方法选择提供坚实依据。
基于最优预处理后的数据分别构建上述3种模型,评估其在实验数据条件下的预测性能。其中,SVM通过寻找最优超平面实现数据回归,采用网格搜索方法,针对高斯核、多项式核及线性核函数进行动态寻优,以确定最佳核函数配置。RF作为一种集成学习算法,通过随机选择样本与特征构建多棵决策树,并综合决策结果提升模型性能。ELM则通过随机初始化输入权重与隐含层偏置,快速确定网络输出权重,从而实现高效学习。
1.4.1 模型输入参数及数据集划分
将剔除异常值后的土壤样品数据按照8∶2随机分为训练集和测试集。本研究所有模型均基于此划分进行构建和精度评价。
1.4.2 模型优化
使用鹅群优化算法(Goose Optimization Algorithm,GOOSE)优化模型参数,并对GOOSE算法进行改进。鹅群优化算法是一种受鹅群警戒行为启发的元启发式算法,其在初始化种群后,通过比较个体适应度值确定当前最优位置。其核心在于利用随机数平衡探索与开发阶段。在开发阶段,算法模拟“石子掉落”与“声音传播”的物理过程来更新个体位置,该过程精确模拟了鹅群个体在收到警报后,基于声音来源的方向和距离进行位置调整的智能行为。这种独特的机制使GOOSE算法在全局探索与局部开发之间建立了有效平衡,从而展现出优异的收敛性能,具体数学模型描述如下。
首先,随机生成守卫鹅所携带石子的重量,该重量决定了局部搜索的步长为
WS=rand([5,25])
(1)
随后,计算石子落地的声音传播距离,该距离定义了搜索的范围,即
DST=VS×TAS
(2)
守卫鹅与群体中其他个体间的距离通过下式求得:
DG=0.5×DST
(3)
最终,个体位置根据上述物理量进行更新。一个核心的位置更新公式为
X(n+1)=VFF+DG×TA2
(4)
式中:VS=343.2 m/s为空气中的声速,TAS为声音传播时间,VFF为石子自由落体速度,TA为声音传播平均时间。
1.4.3 鹅优化算法改进策略
由于鹅群优化算法在迭代过程中通过统一参数控制探索与开发行为,未能在前期充分进行全局搜索,后期也缺乏精细局部探索,导致其易陷入局部最优、收敛速度慢、难以逼近全局最优解。
针对以上问题,在算法迭代过程中,通过式(5)对鹅种群规模进行动态调整:
(5)
式中:t为当前迭代次数,T为总迭代次数,Nt)表示t时刻的种群规模,N0表示总种群规模。
1)在前30%阶段,通过增加种群规模并结合Lévy飞行策略进行搜索,使算法在搜索空间中实现较大范围的探索,有助于跳出局部最优解,发现更具潜力的区域,如式(6)所示:
Xi(t+1)=Xbest (t)-α1Xbest (t)-2r1Xi(t)+L(λ)
(6)
式中:α1= 2e-4L/T2 代表探索强度系数,r1~U(0,1)为分布随机数,Lλ)表示Lévy飞行扰动。
2)在30%~70%阶段,采用原GOOSE算法结合Lévy飞行以及随机搜索策略,平衡算法的全局搜索和局部搜索能力,在扩大搜索范围的同时,对潜在的最优区域进行精细搜索,如式(7)所示:
Xi(t+1)=ωXi(t)+c1r2Xpbest ,i(t)-Xi(t)+c2r3Xgbest (t)-Xi(t)+βL(λ)+γR
(7)
式中:ω代表惯性权重,c1r2为加速常数,c2r3~U(0,1)为随机数, Xpbest,it)代表个体i的历史最优位置,Xgbestt)为全局历史最优位置,β为Lévy飞行权重, γ为随机搜索权重,R~UXminXmax)为搜索空间内的随机点。
3)在后30%阶段,减少种群规模并采用爬山法搜索策略。通过不断向当前解的邻域中更优的解移动,逐步逼近局部最优解,如式(8)所示:
Xi(t+1)=Xi(t)+δfXi(t)+εMXi(t)
(8)
式中:δ表示爬山步长,fXit 表示目标函数在Xi处的梯度估计,ε为邻域搜索强度,MXit))代表混合邻域扰动。
同时,对于处于后30%阶段的个体,采用混合邻域搜索策略,即单维度结合多维度扰动方式。单维度扰动能够在每个维度上对个体位置进行微调,挖掘局部区域的细微差异;多维度扰动则从整体上对个体位置进行较大幅度的调整,增强算法在局部区域的搜索能力,更精准地逼近最优解。
4)算法在每次迭代中按适应度对个体进行排序,选取精英个体并记录当前代最优解到历史集合中,更新所有个体位置后将精英个体放回种群,以保留优良个体信息,引导种群向更优方向进化,精英保留策略如式(9)所示:
S(t)=argsortXP(t)f(X)1:k%H(t+1)=H(t)S(t)
(9)
式中:St)代表当前代适应度最优的前k%个体,Ht)代表历史最优解集,fX)代表适应度函数。
1.4.4 模型精度评价指标
在模型构建过程中,运用5折交叉验证计算平均指标的方法对模型泛化性进行评价,并对比3种模型在训练集和测试集上的均方根误差RMSE及决定系数R2筛选出最优模型[19]
2 结果与分析
2.1 数据预处理
2.1.1 异常值剔除
使用马氏距离算法(MA)剔除异常样本后,将剩余366份土壤样品按照8∶2随机分为训练集和测试集,划分训练集样本量为292份,测试集样本量为74份,用于后续模型构建与精度评价。剔除异常样本后,训练集与测试集的样本有机质质量分数统计如表1所示。
1有机质数据集样本统计
Tab.1Sample statistics of organic matter dataset
2.1.2 光谱预处理
原始及各变换土壤光谱图如图1所示。由图1(a)可以看出,原始土壤光谱(Origin)整体呈现典型的地物反射谱形,其反射率通常随波长的增加而逐渐升高,并在特定波段(如1 400、1 900、2 200 nm附近)因水分、有机质等组分的吸收作用而形成明显的吸收谷;然而,Origin易受颗粒大小、表面粗糙度及测量条件等因素干扰,在图中显示出基线漂移和杂散光噪声。由图1(b)和1(c)可以看出,多元散射校正(MSC)与标准正态变量变换(SNV)能有效压制与光程相关的散射效应,使光谱曲线在纵向上趋于集中,凸显化学组分的吸收特征,从而改善谱形的可比性。由图1(d)可以看出,卷积平滑光谱(SG)通过局部多项式拟合对光谱进行卷积运算,在保留Origin关键特征的前提下,有效平滑细微波动。由图1(e)和1(f)可以看出,一阶导数光谱(D1)能够突出Origin的斜率变化点,精确标识吸收特征的位置与拐点,在1 400 nm(O—H伸缩振动)、1 900 nm(O—H倍频吸收)、2 200~2 300 nm(C—H振动)等有机质相关官能团的吸收位置差异清晰;二阶导数(D2)则进一步对D1的变化率进行响应,对确定吸收谷的中心位置更为敏感,并能有效分辨在Origin中重叠的宽缓吸收带,但噪声凸显强于D1。
1原始及各变换土壤光谱图
Fig.1Original and various transformed soil spectra
表2所示,在基于不同预处理方法建立的PLSR模型性能对比中,一阶导数(D1)预处理展现出显著优势。未经预处理的原始数据所建模型性能最弱,其测试集R2仅为0.200 7,表明模型几乎无法有效解释土壤有机质的变化。SNV、MSC与SG等预处理方法虽对模型性能略有改善,但测试集R2均未超过0.44,提升效果有限。相比之下,光谱导数处理,尤其是一阶导数(D1)预处理,极大地提升了模型性能。D1预处理后的PLSR模型在五折交叉验证、训练集和测试集上均取得了最佳或接近最佳的指标,其测试集R2达到0.637 7,同时RMSE降至9.591 8,证明该处理方法在消除背景干扰、增强有效信号方面非常有效,显著提高了模型的预测精度与稳健性。二阶导数(D2)处理虽在训练集上拟合度很高(R2=0.819 0),但其在测试集上的表现(R2=0.549 7)明显逊于D1,表明模型可能存在一定的过拟合。综合来看,D1能够最有效地从土壤原始光谱中提取与有机质相关的关键信息,故选择D1预处理数据进行后续模型构建。
2不同预处理方法建立的PLSR模型指标
Tab.2Indicators of PLSR models established by different preprocessing methods
2.2 光谱数据降维
2.2.1 全波段光谱数据建模结果分析
基于D1预处理的数据分别构建支持向量机(SVM)、随机森林(RF)、极限学习机(ELM)3种模型。不同模型精度对比如表3所示。可以看出,SVM模型在5折交叉验证中的平均R2为0.762 4,高于RF模型的0.518 9和ELM模型的0.535 1;在训练集和测试集上,SVM模型的R2也相对较高,分别为0.990 6和0.819 5。从表3展示的3种模型性能对比来看,基于D1预处理数据所构建的SVM模型在预测精度与泛化能力方面均表现最佳。在五折交叉验证这一评估模型稳健性的关键指标中,SVM模型的平均R2最高为0.762 4,RMSE最低为7.873 5,说明其在不同数据子集上具有最强的适应性与稳定性。进一步观察训练集与测试集的表现可以看出,RF与ELM在训练集上虽呈现出较高的拟合优度,但其测试集结果出现明显下降,尤其是ELM,训练集R2高达0.953 2,而测试集R2仅为0.575 9,反映出一定的过拟合风险。相比之下,SVM模型在训练集上达到极优的拟合效果(R2=0.990 6),同时在测试集上仍能保持最高的R2(0.819 5)与最低的RMSE(5.245 8),显示出其出色的泛化能力与实用价值,此时的最佳核函数类型为Gaussian。综合来看,在基于D1预处理光谱数据反演土壤有机质质量分数时,SVM为3种模型中最可靠与有效的建模选择,因此,采用Gaussian核函数的SVM模型为后续实验的基础模型。
3不同模型精度对比
Tab.3Comparison of accuracy among different models
2.2.2 降维光谱数据建模结果分析
采用竞争性自适应重加权采样(CARS)、随机蛙跳(RFROG)、连续投影算法(SPA)对光谱降维后的特征波段分布如图2所示。从筛选波段在350~2 500 nm光谱范围内的分布可以看出,各方法所选波段均集中在若干特定区域,尤其在2 000~2 400 nm分布较多,反映出这些波长位置对土壤有机质具有较强的光谱响应,被共同选中的波段区域可能对应有机质中C—H、N—H、O—H等官能团的振动吸收带。其中,可见光区域的筛选结果可能与土壤有机质颜色特征相关,近红外区域的波段则与土壤中含氢基团的合频和倍频吸收有关。
2特征波段分布
Fig.2Characteristic band distribution
对3种算法降维后的数据再次构建SVM模型以确定最佳降维方法,各模型精度如表4所示。分析表4中3种降维方法结合SVM模型的精度对比结果可以看出,CARS算法在降维后构建的SVM模型中表现最为优异,其在五折交叉验证、训练集和测试集上的R2均为最高,RMSE均为最低,尤其在测试集上R2达0.777 5,RMSE为6.640 7,表明模型具有出色的预测精度和良好的泛化能力,能有效保留光谱数据中的关键特征。RFROG方法构建的模型在各数据集上表现较为一致,R2为0.62~0.65,虽未出现明显过拟合,但整体精度一般,说明其降维效果较为保守,信息提取能力有限。SPA方法构建的模型五折交叉验证R2仅为0.231 1,远低于其在训练集上的0.819 9,表明该方法选出的特征集泛化性差,可能与所选波段过于稀疏、丢失关键信息有关。尽管SPA在测试集上R2为0.679 9,但综合其交叉验证表现,SPA方法降维结果的可靠性和实用性均明显不足。综上,CARS是最有效的降维方法,其在显著压缩数据维度的同时,最大程度地保留了用于建模的关键光谱信息,为构建高精度、强泛化能力的土壤有机质反演模型提供了有力支持,因此,选择CARS方法降维数据进行后续模型优化。
4降维后数据建立的SVM模型精度对比
Tab.4Comparison of accuracy of SVM models established by data after dimensionality reduction
2.3 模型优化结果分析
2.3.1 改进鹅群算法性能测试对比
将IGOOSE和GOOSE在CEC2022测试函数上进行对比,设定种群迭代次数为500、种群大小为40、测试函数维度为20,每个算法运行30次求解12个测试函数的均值(Mean)、标准差(Std)、最好值(Best)、最差值(Worst),改进鹅算法CEC2022测试函数测试结果对比如表5所示,对比雷达图如图3所示。从表5可以看出,改进鹅优化算法(IGOOSE)相较于原始算法(GOOSE)在多数函数中展现出更优的性能。在函数F1、F3、F5和F9上,两种算法均能接近理论最优值,但IGOOSE的标准差普遍更低,体现出更稳定的收敛特性。如在F3中,IGOOSE的标准差为2.441 3E-04,远低于GOOSE的4.364 7E-02,说明其解的质量波动更小。
5改进鹅算法CEC2022测试函数测试结果对比
Tab.5Comparison of test results of CEC2022 test functions for improved goose swarm optimization algorithm
3改进鹅算法CEC2022测试函数结果对比雷达图
Fig.3Radar chart of comparison of CEC2022 test function results for improved goose swarm optimization algorithm
在较为复杂的多峰函数和复合函数中,IGOOSE的优势更为明显。函数F2、F4、F6、F7、F10和F11中,IGOOSE不仅在平均值上显著优于GOOSE,其最优解和最差解也普遍更优。如在F6中,IGOOSE的平均值为3.226 4E+03,明显低于GOOSE的4.214 9E+03,同时,其最差解7.807 0E+03也优于GOOSE的8.065 2E+03,显示出更强的全局探索能力和鲁棒性。
部分函数如F8和F12中,两种算法的表现较为接近,但IGOOSE仍在平均值和稳定性上略占优势。整体而言,改进算法在绝大多数测试函数中均表现出更好的收敛精度和稳定性,验证了其改进策略在提升算法性能方面的有效性,在应用到SVM超参数优化时能获得较高精度和稳定性的模型。
2.3.2 IGOOSE算法优化SVM
以训练集的均方误差为适应度函数,用IGOOSE算法优化SVM的两个超参数进行土壤有机质回归,具体优化步骤流程如图4所示。
使用GOOSE和IGOOSE对SVM模型的惩罚因子C、核函数类型以及核函数参数γ进行优化,GOOSE-SVM与IGOOSE-SVM模型精度对比如表6所示。
4IGOOSE算法流程
Fig.4Flow of IGOOSE algorithm
6GOOSE-SVM与IGOOSE-SVM模型精度对比
Tab.6Comparison of accuracy between GOOSE-SVM and IGOOSE-SVM models
表6的模型精度对比结果可以看出,改进的鹅群优化算法(IGOOSE)在提升支持向量机模型性能方面表现出显著优势。与原始GOOSE算法相比,IGOOSE寻得了一组不同的SVM参数组合,其惩罚系数C更小而核参数γ更大,较小的C值与较大的γ值可能有助于缓解过拟合,提升模型泛化能力,这一配置有助于模型在拟合与泛化之间取得更好平衡。说明在处理复杂的土壤光谱数据建模问题时,多阶段搜索策略和动态种群调整机制,使其能够更好地适应数据的复杂特征空间。通过Lévy飞行和随机搜索策略,IGOOSE算法在全局搜索过程中能够更广泛地探索解空间,避免算法陷入局部最优;而在局部搜索阶段,爬山法和混合邻域搜索策略的结合,使得算法能够在局部区域内进行精细搜索,提高对最优解的逼近精度。
从模型稳健性来看,IGOOSE-SVM在五折交叉验证中取得了更高的平均R2和更低的RMSE,表明其在不同数据子集上具有更稳定的预测性能。进一步分析训练集与测试集上的表现,IGOOSE-SVM在训练集上展现出极高的拟合优度,R2达0.925 2,同时,这种优异的拟合能力被有效传递至测试集,其R2提升至0.841 6,RMSE降低至7.040 7 g/kg,该结果在图5的模型散点图中得到可视化验证,IGOOSE-SVM模型的预测值与真实值紧密围绕在1∶1线两侧,离散程度低且无系统性偏差,相比之下,GOOSE-SVM模型在训练集上的表现已相对平庸,图中预测点的分布相对分散,表现出更明显的离散和偏离趋势。
综合表明,IGOOSE算法通过更有效的参数搜索策略,不仅显著提升了模型对数据特征的捕捉能力,更保证了优秀性能的泛化性,成功构建了一个兼具高精度与强稳健性的土壤有机质质量分数预测模型。
5GOOSE-SVM 与IGOOSE-SVM模型真实值与预测值散点图
Fig.5Scatter plots of actual and predicted values for GOOSE-SVM and IGOOSE-SVM models
3 讨论
本研究通过改进鹅群优化算法(IGOOSE),有效缓解了土壤有机质繁衍模型在复杂光谱环境中收敛精度低、易陷入局部最优解等问题。研究表明,通过动态调整种群规模,并融合Lévy飞行、随机扰动及混合邻域搜索等策略,IGOOSE算法能够稳定、高效地优化支持向量机(SVM)的超参数,从而实现土壤有机质的高精度反演。
在光谱数据预处理与特征筛选方面,本研究系统对比了多种方法,最终采用一阶导数(D1)和竞争性自适应重加权采样(CARS)相结合的处理流程。Peng等[20]研究指出,一阶导数处理有助于抑制背景噪声并增强与有机质相关的微弱吸收特征。Pan等[21]也证实CARS方法在多种光谱数据类型中均表现出良好的筛选能力,有助于提升模型的预测精度与鲁棒性。这些发现与本研究结论一致,共同验证了所选预处理与特征选择方法的有效性。
本研究的关键在于通过优化SVM模型参数,显著提升了土壤有机质质量分数的反演精度。以往研究多采用网格搜索、遗传算法(GA)或粒子群算法(PSO)等传统优化器进行参数调优。如Beltrami等[22]利用网格搜索优化SVM,虽有效但计算成本高昂;Li等[23]采用PSO优化SVM模型,虽提升了训练效率,但仍受早熟收敛问题的制约。相比之下,本研究提出的IGOOSE算法展现出了更优异的全局探索和局部开发能力。具体而言,IGOOSE所寻获的SVM参数组合具有较小的惩罚系数C与较大的核参数γ,这一配置通常被认为有助于抑制过拟合、提升模型泛化性能[24-25]。其优越性主要源于多阶段搜索机制与动态种群策略的引入:在全局搜索阶段,Lévy飞行和随机搜索策略协同增强了算法对解空间的广泛探索,有效避免陷入局部最优;在局部开发阶段,结合爬山法与混合邻域搜索策略,实现对潜在最优区域的精细搜索,从而显著提高了参数估计精度。这种“宏观探索-微观开发”协同机制使IGOOSE更好地适应土壤光谱数据高维、非线性的特征空间,最终获得泛化性能更优的SVM模型,测试集指标(R2=0.841 6,RMSE=7.040 7 g/kg)也实证性地超越传统优化方法。值得指出的是,Bao等[26]通过引入动态策略构建多元深度学习模型,Zhang等[27]通过改进优化算法机制来提升SVM分类效果,同样验证了动态机制在提升模型表达能力方面的必要性,进一步佐证了本研究的改进方向。
尽管本研究构建的IGOOSE-SVM模型在处理高维非线性土壤光谱数据方面表现优异,其普适性仍有待在更广泛的条件下验证。目前,模型训练所采用的数据来源于特定黑土经干燥研磨处理的样本,尚未考虑实际环境中土壤含水量、不同质地等因素的影响。此外,不同区域土壤属性的空间异质性也可能限制模型的迁移能力[25-26]。因此,后续研究将致力于收集涵盖不同质地、含水量等条件的多样化样本,并引入地形因子与植被指数等辅助变量,系统评估各项因素对模型性能的影响,以构建一个普适性强、精度高的土壤有机质通用反演模型。此外,本研究虽验证了IGOOSE相对于传统优化器的优势,未来仍需将其与更多最新提出的先进优化算法进行更全面的横向比较,以进一步明确其性能边界与应用场景。
4 结论
1)在马氏距离算法剔除异常样本的基础上,采用一阶导数(D1)对土壤有机质高光谱数据进行预处理,能够在抑制噪声干扰的同时,较好地保留和突出有效光谱特征信息。
2)在SVM、RF与ELM 3种机器学习模型中,SVM在训练集与测试集上均表现出更优的拟合效果与泛化能力,适用于土壤有机质质量分数的高光谱反演建模。
3)对比CARS、RFROG和SPA 3种特征选择方法,CARS算法所保留的特征维度虽高于其他方法,但基于其构建的SVM模型预测性能最佳,其在降维过程中更能有效保留关键信息。
4)为进一步提升模型性能,提出多种策略改进的鹅群算法(IGOOSE),其优化的SVM模型在泛化能力上显著优于原GOOSE算法,训练集与测试集的R2分别提升0.106 6与0.041 1,RMSE分别降低2.541 3 g/kg与0.528 7 g/kg,模型性能满足实际应用要求。
本研究提出的改进策略,解决了GOOSE算法在高维复杂土壤光谱场景下鲁棒性与收敛精度不足的问题,IGOOSE通过引入自适应优化机制,显著提升了黑土有机质高光谱反演的精度与稳定性,为复杂土壤环境下的有机质检测提供了鲁棒性强、精度高的创新方法。此外,这一改进策略构成了一体化建模框架的核心基础,该框架融合了光谱预处理与特征选择等环节,数据处理方法及核心优化逻辑展现出良好的迁移性与普适性,为不同区域、不同类型土壤的有机质快速无损检测提供了重要的技术支撑与方法论借鉴,对推动高光谱技术在精准农业及区域环境监测中的规模化应用具有积极意义。
1原始及各变换土壤光谱图
Fig.1Original and various transformed soil spectra
2特征波段分布
Fig.2Characteristic band distribution
3改进鹅算法CEC2022测试函数结果对比雷达图
Fig.3Radar chart of comparison of CEC2022 test function results for improved goose swarm optimization algorithm
4IGOOSE算法流程
Fig.4Flow of IGOOSE algorithm
5GOOSE-SVM 与IGOOSE-SVM模型真实值与预测值散点图
Fig.5Scatter plots of actual and predicted values for GOOSE-SVM and IGOOSE-SVM models
1有机质数据集样本统计
Tab.1Sample statistics of organic matter dataset
2不同预处理方法建立的PLSR模型指标
Tab.2Indicators of PLSR models established by different preprocessing methods
3不同模型精度对比
Tab.3Comparison of accuracy among different models
4降维后数据建立的SVM模型精度对比
Tab.4Comparison of accuracy of SVM models established by data after dimensionality reduction
5改进鹅算法CEC2022测试函数测试结果对比
Tab.5Comparison of test results of CEC2022 test functions for improved goose swarm optimization algorithm
6GOOSE-SVM与IGOOSE-SVM模型精度对比
Tab.6Comparison of accuracy between GOOSE-SVM and IGOOSE-SVM models
GOIDTS E, VAN WESEMAEL B, CRUCIFIX M. Magnitude and sources of uncertainties in soil organic carbon(SOC)stock assessments at variousscales[J]. European Journal of Soil Science,2009,60(5):723. DOI:10.1111/j.1365-2389.2009.01157
晏锦辉, 王涵, 赵怡凯, 等. 黑土区坡耕地表层土壤抗冲性及团聚体流失特征[J]. 中国水土保持科学(中英文),2025,23(1):211. YAN Jinhui, WANG Han, ZHAO Yikai,et al. The surface soil anti-scouribility and aggregate loss characteristics in cultivated land of the black soil area[J]. Science of Soil and Water Conservation,2025,23(1):211. DOI:10.16843/j.sswc.2024072
戴慧敏, 刘凯, 宋运红, 等. 东北地区黑土退化地球化学指示与退化强度[J]. 地质与资源,2020,29(6):510. DAI Huimin, LIU Kai, SONG Yunhong,et al. Black soil degradation and intensity in northeast China:geochemical indication[J]. Geology and Resources,2020,29(6):510. DOI:10.13686/j.cnki.dzyzy.2020.06.002
GERKE J. The central role of soil organic matter in soil fertility and carbonstorage[J]. Soil Systems,2022,6(2):33. DOI:10.3390/soilsystems6020033
SUN Weichao, LIU Shuo, ZHANG Xia,et al. Estimation of soil organic matter content using selected spectral subset of hyperspectral data[J]. Geoderma,2022,409:115653. DOI:10.1016/j.geoderma.2021.115653
LEI Wanying, PAN Qiang, TENG Peiji,et al. How does soil organic matter stabilize with soil and environmental variables along a black soil belt in Northeast China?An explanation using FTIR spectroscopy data[J]. CATENA,2023,228:107152. DOI:10.1016/j.catena.2023.107152
WANG Haoyu, SUN Qian, NIU Xin,et al. Soil organic carbon prediction using an efficient channel attention-enhanced CNN-LSTM model with LUCAS spectral library[J]. European Journal of Soil Science,2025,76(5):e70202. DOI:10.1111/ejss.70202
HAMAD R K, RASHID T A. GOOSE algorithm:a powerful optimization tool for real-world engineering challenges andbeyond[J]. Evolving Systems,2024,15(4):1249. DOI:10.1007/s12530-023-09553-6
李英顺, 姬宏基, 于昂, 等. 一种基于VMD-IGOA-XGBoost的火控系统故障诊断方法[J]. 火炮发射与控制学报,2025,46(4):37. LI Yingshun, JI Hongji, YU Ang,et al. A fault diagnosis method for fire control systems based on VMD-IGOA-XGBoost[J]. Journal of Gun Launch & Control,2025,46(4):37. DOI:10.19323/j.issn.1673-6524.202407014
TIKHAMARINE Y, SOUAG-GAMANE D, AHMED A N,et al. Improving artificial intelligence models accuracy for monthly streamflow forecasting using grey Wolf optimization(GWO)algorithm[J]. Journal of Hydrology,2020,582:124435. DOI:10.1016/j.jhydrol.2019.124435
张戈, 盖赟. 局部离群因子算法(LOF)在异常检测中的应用研究[J]. 网络安全技术与应用,2020(11):49. ZHANG Ge, GAI Yun. Research on the application of Local Outlier Factor(LOF)algorithm in anomaly detection[J]. Network Security Technology & Application,2020(11):49. DOI:10.3969/j.issn.1009.2020.11.029
黄梦蝶, 王禄丰, 黄旭星, 等. 基于平方马氏距离的空间目标碰撞风险分析算法[J/OL].[2025-09-30].https://doi.org/10.13700/j.bh.1001-5965.2024.0167. HUANG Mengdie, WANG Lufeng, HUANG Xuxing,et al. Space target collision risk analysis algorithm based on the square Mahalanobis distance[J/OL].[2025-09-30].https://doi.org/10.13700/j.bh.1001-5965.2024.0167
孙嘉豪, 张伟, 施鉴芩, 等. 光谱数据预处理策略选择及应用[J]. 计量学报,2023,44(8):1284. SUN Jiahao, ZHANG Wei, SHI Jianqin,et al. Selection and application of spectral data preprocessing strategy[J]. Acta Metrologica Sinica,2023,44(8):1284. DOI:10.3969/j.issn.1000-1158.2023.08.20
李雨鸿, 冯锐, 纪瑞鹏, 等. 基于CR-CARS-RF的黑土区土壤有机质含量高光谱估算[J]. 干旱地区农业研究,2025,43(4):203. LI Yuhong, FENG Rui, JI Ruipeng,et al. Hyper-spectral estimation of soil organic matter content in black soil based on CR-CARS-RF[J]. Agricultural Research in the Arid Areas,2025,43(4):203. DOI:10.7606/j.issn.1000-7601.2025.04.21
YAO Xiangqian, YANG Wei, LI Minzan,et al. Prediction of total nitrogen in soil based on random frog leaping wavelet neural network[J]. IFAC-PapersOnLine,2018,51(17):660. DOI:10.1016/j.ifacol.2018.08.121
沈强, 张世文, 夏沙沙, 等. 基于支持向量机的土壤有机质高光谱反演[J]. 安徽理工大学学报(自然科学版),2019,39(4):39. SHEN Qiang, ZHANG Shiwen, XIA Shasha,et al. Hyperspectral inversion of soil organic matter based on support vector machine[J]. Journal of Anhui University of Science and Technology(Natural Science),2019,39(4):39. DOI:10.3969/j.issn.1672-1098.2019.04.007
刘恬琳, 朱西存, 白雪源, 等. 土壤有机质含量高光谱估测模型构建及精度对比[J]. 智慧农业(中英文),2020,2(3):129. LIU Tianlin, ZHU Xicun, BAI Xueyuan,et al. Hyperspectral estimation model construction and accuracy comparison of soil organic matter content[J]. Smart Agriculture,2020,2(3):129. DOI:10.12133/j.smartag.2020.2.3.201912-SA004
张文帅, 王占刚. 基于改进麻雀算法优化深度极限学习机的缺失数据预测[J]. 电子测量技术,2022,45(15):63. ZHANG Wenshuai, WANG Zhangang. Missing data prediction based on improved sparrow algorithm optimized deep extreme learning machine[J]. Electronic Measurement Technology,2022,45(15):63. DOI:10.19651/j.cnki.emt.2209216
张贤龙, 张飞, 张海威, 等. 基于光谱变换的高光谱指数土壤盐分反演模型优选[J]. 农业工程学报,2018,34(1):110. ZHANG Xianlong, ZHANG Fei, ZHANG Haiwei,et al. Optimization of soil salt inversion model based on spectral transformation from hyperspectral index[J]. Transactions of the Chinese Society of Agricultural Engineering,2018,34(1):110. DOI:10.11975/j.issn.1002-6819.2018.01.015
PENG Shan, LIU Junyi, HE Zhonghai,et al. A novel infrared spectral preprocessing method based on self-deconvolution and differentiation in the frequency domain[J]. Vibrational Spectroscopy,2023,127:103562. DOI:10.1016/j.vibspec.2023.103562
PAN Zhaoxuan, ZHAO Xiaoyu, ZHAO Yue,et al. An enhanced IWCARS method for measuring soil available potassium[J]. Chemometrics and Intelligent Laboratory Systems,2025,258:105324. DOI:10.1016/j.chemolab.2025.105324
BELTRAMI M, DA SILVA A C L. A grid-quadtree model selection method for support vector machines[J]. Expert Systems with Applications,2020,146:113172. DOI:10.1016/j.eswa.2019.113172
LI Ying, TONG Yan, BAI Bendu,et al. An improved particle swarm optimization for SVM training[C]//Proceedings of the Third International Conference on Natural Computation(ICNC). New York: IEEE,2007,2:611. DOI:10.1109/ICNC.2007.222
LUO Linkai, YANG Qiaoling, PENG Hong,et al. MaxMin-L2-SVC-NCH:a novel approach for support vector classifier training and parameter selection[J]. Neurocomputing,2025,623:129438. DOI:10.1016/j.neucom.2025.129438
KALITA D J, SINGH V P, KUMAR V,et al. A dynamic framework for tuning SVM hyper parameters based on Moth-Flame Optimization and knowledge-based-search[J]. Expert Systems with Applications,2021,168:114139. DOI:10.1016/j.eswa.2020.114139
BAO Yilin, MENG Xiangtian, LIU Xingnan,et al. Integrating bi-dynamic strategy and multivariate deep learning algorithms to predict high-accuracy,long-term cropland soil organic matter[J]. International Soil and Water Conservation Research,2025,14(2):58. DOI:10.1016/j.iswcr.2025.11.006
WEI Jiaxuan, ZHANG Ruisheng, YU Zhixuan,et al. A BPSO-SVM algorithm based on memory renewal and enhanced mutation mechanisms for feature selection[J]. Applied Soft Computing,2017,58:176. DOI:10.1016/j.asoc.2017.04.061