
封面
全文链接:https://tecdat.cn/?p=46538
原文出处:拓端数据部落公众号
摘要
本文围绕以下核心问题展开研究:
Digest: This study constructs a provincial ecological security early warning system using entropy weighting, PSR framework, and GM(1,1) grey prediction model. Taking Jiangsu Province (2000-2019) as a case with 25 indicators, the study finds ecological security improved from “danger” to “medium warning” level, with policy interventions post-2010 playing a key role. Future predictions indicate continued improvement through 2025.
引言
笔者在从事机器学习与数据挖掘研究的过程中,曾接触过多个区域生态环境评价的咨询项目。其中,省级生态安全预警机制的统计测度是一项兼具学术价值与现实意义的工作。生态安全作为生态文明建设的重要组成部分,其预警体系的建立能够为区域可持续发展提供量化依据。
本文以江苏省为研究对象,选取25项涵盖工业、经济、交通、人口等方面的指标,采用拉格朗日插值法填补缺失值、Alpha模型分析数据可靠性、min-max法进行标准化处理,进而运用熵值法赋权并构建PSR(压力-状态-响应)模型评价生态安全状况。最后,基于2000-2019年生态安全指数,利用GM(1,1)灰色预测模型对未来五年趋势进行预测。
本文将我们的PSR-熵值法-GM(1,1)建模经验沉淀为一个对话式AI智能体,帮助研究者和学生快速构建生态安全预警体系。
阅读原文进群获取本文完整代码、数据、AI智能体及更多最新AI见解和行业洞察,可与900+行业人士交流成长;还提供人工答疑,拆解核心原理、代码逻辑与业务适配思路;遇代码运行问题,更能享24小时调试支持。
关于分析师
在此对Guoqing Zhao对本文所作的贡献表示诚挚感谢,他完成了数据科学与大数据技术专业的学位,专注数据科学与软件开发领域。擅长Python、SPSS。
Guoqing Zhao曾在合肥中科洁睿净化设备有限公司担任软件开发工程师,负责软件系统开发与数据维护相关工作。
数据预处理
指标选择与数据来源
本文基于“自然-社会-经济”复合生态系统理论,参考傅伯杰、刘普幸、赵雪雁等学者的研究,从人口、经济、社会、工业等方面选取了25项具有代表性的指标。数据来源于国家统计局、EPS数据平台和中经数据等权威渠道。

缺失值填补
由于数据来源的权威性,未发现明显异常值,但部分数据存在缺失。本文采用拉格朗日插值法进行填补。
拉格朗日插值法的原理可以这样理解:就像你在一张纸上标了几个点,然后要画一条光滑的曲线穿过所有这些点。数学上,已知n+1个不同数据点(x0,y0)到(xn,yn),可以构造一个至多n次的多项式φ(x),使其在每个节点处与原函数取值相同。截断误差(插值余项)的大小取决于函数在该区间内的高阶导数性质。
同时使用Alpha模型对插值结果进行可靠性分析,最终选取可靠性较高的数据进行填补。
数据标准化
由于各指标数据量纲不同,采用min-max方法进行标准化处理。
对于正向指标:y = (x - min) / (max - min)
对于负向指标:y = (max - x) / (max - min)
其中y表示标准化后的值,x为原始值,max和min分别为该指标在各年中的最大值和最小值。
生态安全评价指标量化研究
熵值法赋权
为避免主观因素影响,采用熵值法对指标层进行赋权。熵值法根据数据离散程度进行赋权——数据离散程度越大,信息量越多,权重相应越大。
具体步骤如下:
赋权结果显示,权重排名前列的指标包括:人均水资源量(21.799%)、城镇失业登记率(7.722%)、单位人口医疗卫生机构床位数(5.594%)、第三产业GDP比重(5.497%)、人均家庭总收入(5.235%)、液化石油供气量(4.779%)、全省GDP总量(4.566%)、人均GDP(4.54%)、恩格尔系数(4.107%)等。

图表 1 重要度直方图

从重要度直方图可以看出,人均水资源量的权重远超其他指标,说明水资源状况是影响江苏省生态安全的关键因素。城镇失业登记率和单位人口医疗卫生机构床位数分列二三位,反映了社会因素在生态安全评价中同样占据重要地位。
综合得分分析
根据熵值法计算的综合得分结果如下表所示:
2004年综合得分最低(0.2874),处于重警级别;2019年综合得分最高(0.5108),进入中警级别。整体来看,2000-2010年间江苏省生态安全持续处于重警状态,2010年后开始逐步好转。
相关文章

相关阅读
READ MORE
Python用TOPSIS熵权法重构粮食系统及期刊指标权重多属性决策MCDM研究|附数据代码 – 拓端
构建江苏省生态安全评价体系
PSR模型选择
本文选取经济合作与发展组织(OECD)提出的PSR模型构建生态安全评价体系。该模型由三部分组成:
预警等级划分
依据相关研究成果,将生态安全等级划分为5个等级:
评价结果分析
综合评价结果:
2000年至2010年间,江苏省生态安全始终处于重警状态。工业废水排放量、工业SO2排放量、人口密度等负向指标显著增加,而人均公园绿地面积、环境污染治理投资占比等正向指标增长缓慢。这说明在此期间,江苏省大力发展工业经济的政策对生态安全造成了明显压力。
2010年后,江苏省生态安全状况开始好转。这与2010年7月《苏州市关于建立生态补偿机制的建议》及《2010年江苏省主要污染物总量减排检测体系建设考核办法》等政策的出台密切相关。
压力层分析:
压力层安全指数呈先下降后上升的趋势,分为两个阶段:2000-2006年为下降期,2006-2019年为波动上升期。下降阶段,工业SO2排放量从1140991吨增至1241000吨,工业废水排放量从201923万吨增至287819万吨,人均公园绿地面积从14.77平方米降至9.6平方米。上升阶段,恩格尔系数从37.2%降至25.47%,全省GDP从21240.79亿元增至98656.82亿元,第三产业GDP占比从36.63%升至51.54%。
状态层分析:
状态层状况呈波动上升趋势。人均GDP逐年稳步增长,二十年间增长了109193.89元。第三产业GDP比重增加有效调整了产业结构。人均家庭总收入从6756元/人增长到51056.11元/人。但城市建成区面积扩张占用了大量土地资源,在一定程度上影响了生态安全。
响应层分析:
响应层状态有所好转。环境污染治理投资占比从1.14%上升到1.62%,城市污水厂集中处理率和建成区绿化覆盖率均呈上升趋势。公共电车数从20031辆增加到44976辆,有效减轻了资源压力。
答辩高频提问:为什么选择PSR模型而非DPSIR模型?
答:PSR模型具有清晰的因果关系链条——压力导致状态变化,状态变化引发响应措施。对于省级生态安全评价而言,PSR模型的简洁性和可解释性更适合。DPSIR虽然在PSR基础上增加了驱动力和影响层,但数据需求更大,且在指标选取上容易产生交叉重叠,对于本研究的时间跨度和数据可得性而言,PSR模型更为适宜。
江苏省生态安全预警预测
GM(1,1)模型选择
土地生态系统是一个复杂的灰色系统,其内部因素关系并不完全明确。灰色预测模型适用于少样本、中短期预测,由邓聚龙教授提出。GM(1,1)模型通过原始数据的累加生成,发现数据蕴含的指数规律,进而建立微分方程进行预测。
级比检验
为确保数据适合构建GM(1,1)模型,首先进行级比检验。原始数据部分级比值超出区间(e^(-2/(n+1)), e^(2/(n+1))),即(0.909, 1.1)。因此对序列进行平移转换,平移后所有级比值均落在(0.909, 1.1)区间内,满足建模要求。
模型构建
构建GM(1,1)模型求得发展系数a=-0.008,灰色作用量b=1.271,后验差比C=0.156。
后验差比C值是衡量模型精度的重要指标——C值越小,模型精度越高。一般认为C<0.35精度高,C<0.5合格,C<0.65基本合格。本研究C=0.156,模型精度高。
残差检验
对模型拟合值进行残差检验,结果如下表(部分):
模型平均相对误差为5.224%,小于20%的阈值标准,说明模型拟合效果良好。
预测结果
基于GM(1,1)模型对未来五年(2020-2024年)生态安全指数的预测结果:
预测结果显示,江苏省未来五年生态安全指数持续上升,从0.487增至0.534,始终处于中警级别但逐步向轻警级别靠近。这表明江苏省生态安全状况将继续改善。

答辩高频提问:GM(1,1)模型的预测可靠性如何保证?
答:本研究从三个方面验证了模型可靠性:一是通过级比检验确认数据适合建模,平移转换后所有级比值均在(0.909, 1.1)区间内;二是后验差比C=0.156远小于0.35的高精度阈值;三是平均相对误差5.224%远低于20%的合格标准。此外,GM(1,1)模型适用于少样本中短期预测,本研究20年的数据量在模型适用范围内,预测未来5年属于中短期预测,结果可信度较高。
Python代码实现
第一轮对话:基础模型构建
我有一份江苏省2000-2019年的生态安全指数数据,需要进行灰色预测建模。请帮我用Python实现GM(1,1)模型,包括数据预处理(累加生成)、参数估计(最小二乘法)、拟合预测和结果可视化。需要注意对原始数据进行级比检验,如果不通过需要做平移转换。
import matplotlib.pyplot as plt
def lagrange_interp(x_vals, y_vals, x_target):
term = term * (x_target - x_vals[j]) / (x_vals[i] - x_vals[j])
阅读原文进群获取完整内容及更多AI见解、行业洞察,与900+行业人士交流成长。
第二轮对话:引入熵值法赋权与综合评价
我的数据包含25项指标,现在需要先使用熵值法计算各指标权重,再用PSR模型框架计算综合得分。请帮我实现熵值法赋权的完整流程,包括数据标准化、比重计算、熵值计算和权重求解。同时需要输出各指标权重排名和综合得分。
def minmax_normalize(data, positive_flags):
"""min-max标准化,positive_flags标记正向/负向指标"""
normalized = np.zeros_like(data, dtype=float)
for j in range(data.shape[1]):
normalized[:, j] = (col - col.min()) / (col.max() - col.min() + 1e-12)
normalized[:, j] = (col.max() - col) / (col.max() - col.min() + 1e-12)
总结
核心问题与解决方案
问题一:如何科学构建省级生态安全预警指标体系?
解决方案:基于PSR模型框架,从压力、状态、响应三个维度选取25项指标,涵盖工业、经济、交通、人口等方面,数据来源于权威统计渠道,确保指标体系的全面性和可靠性。
问题二:如何客观赋权并评价生态安全状况?
解决方案:采用熵值法进行客观赋权,避免主观因素干扰。人均水资源量权重最高(21.799%),说明水资源是影响江苏省生态安全的核心因素。综合得分显示2000-2010年处于重警状态,2010年后逐步好转至中警级别。
问题三:生态安全未来趋势如何预测?
解决方案:基于灰色系统理论构建GM(1,1)模型,级比检验通过,后验差比C=0.156(精度高),平均相对误差5.224%。预测未来五年生态安全指数从0.487升至0.534,趋势向好。
技术创新与业务价值
作者系数据挖掘领域分析师,拥有多年统计建模经验。
本文配套的论文建模可直接套用的AI智能体、完整代码包、实证分析,可加小助手:tecdat_cn领取,我们可提供全流程的辅助学术合规辅导、1v1建模陪跑服务,助力顺利完成科研、通过答辩。


资料获取
在公众号后台回复“领资料”,可免费获取数据分析、机器学习、深度学习等学习资料。

点击文末“阅读原文”
获取完整智能体、
代码、数据和文档。




