世界银行-几乎从零开始预测收入分配(英)-2025.1_41页_6mb
报告摘要
总结报告:Predicting Income Distributions from Almost Nothing
1. 研究目的:
提出一种基于简单回归的方法,利用国家层面的变量预测全球168个国家的年度收入和消费分布,以弥补数据匮乏地区(如冲突或资源有限国家)调查数据缺失的不足。
2. 方法与数据:
- 数据来源: 采用世界银行的1,989个家庭调查数据,覆盖1991-2020年间168个国家的收入和消费分布(ppp调整后美元),每份数据包含99个分位数。
- 预测变量: 使用超过1,000个候选变量,包括经济指标(如GDP、婴儿死亡率、预期寿命)、健康指标(如人均寿命、死亡率)以及遥感数据等。
- 模型构建: 采用分位数回归模型,基于Fisk分布(一种对数洛格斯蒂分布)预测收入和消费分布,确保分布的形状合理且可扩展。
3. 关键发现:
- 一个包含人均GDP、婴儿死亡率、预期寿命和农村人口占比等少数变量的简单模型,预测精度可与使用1,000多个变量的复杂机器学习模型媲美。
- GDP被证明是最有效的预测变量,即使在数据匮乏的国家;遥感数据(如夜间灯光)表现不佳,不显著提升模型精度。
- 预测平均误差为30%,虽在绝对数值上较大,但与全球范围内巨额收入差异相比相对较小,且模型无法通过增加更多变量进一步改进误差。
4. 模型应用与验证:
- 该方法可用于预测无调查数据国家的贫困水平,全球贫困趋势总体上与世界银行现有估算一致,但在个别国家(如中国、印度)存在偏差,可能源于这些国家调查数据测量方法的变化。
- 模型适用于世界银行全球与区域贫困测量,设置约3%的人口数据缺失的国家,模型预测仅略微调整了全球贫困头数。
5. 结论与意义:
- 提出了一种简单实用的分布预测方法,解决了数据匮乏地区无调查数据的贫困监测难题。
- 该方法可辅助政策制定者在没有完整调查数据的情况下,进行贫困和收入分配分析,尤其适用于脆弱国家和地区。
- 通过客观比较表明,简单模型在准确性、可用性和可靠性上均优于复杂的替代方法,同时具有广泛的适用性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载