2006年-世界发展银行全球_Jointness_in_Bayesian_Variable_Selection_with_Applications_to_Growth_Regression_17页_592kb
报告摘要
总结:Jointness in Bayesian Variable Selection with Applications to Growth Regression
核心内容
本文探讨了在贝叶斯变量选择框架下,如何衡量变量之间的联合性(Jointness),并将其应用于经济增长回归分析。作者提出了两种新的联合性度量指标,以更准确地捕捉变量之间的依赖关系,对比了之前提出的其他度量方法,并通过两个实际数据集(FLS数据集和DW数据集)进行实证分析。
主要观点
- 经济增长回归的模型不确定性:由于经济增长的开放性,不同理论可能提出不同的决定因素,导致模型不确定性较高。因此,需要使用贝叶斯模型平均(BMA)来处理这种不确定性。
- 联合性与替代性:变量之间可能存在联合性(即它们通常一起出现在模型中)或替代性(即它们通常不同时出现)。联合性可以视为变量是互补(Complements),而替代性则视为替代(Substitutes)。
- 现有联合性度量的不足:DW提出的联合性度量存在一些问题,例如当变量的后验包含概率接近1时,该度量无法有效区分联合性,且在极端情况下(如变量总是同时出现)会导致度量结果不稳定或无意义。
- 新的联合性度量:作者提出了两个新的度量指标:
- $\mathcal{J}_{ij}^{\star} = \frac{P(i \cap j)}{P(i \cup j)}$,表示联合包含概率与包含任一变量的概率之比,范围在 [0, 1]。
- $\mathcal{J}_{ij} = \frac{P(i \cap j)}{P(i \cap \tilde{j}) + P(j \cap \tilde{i})}$,表示联合包含概率与不同时包含的概率之比,范围在 [0, ∞)。
- 本文还推广了这两个度量至多个变量的集合,分别定义为 $\mathcal{J}{\mathcal{S}}^{\star}$ 和 $\mathcal{J}{\mathcal{S}}$。
- 联合性度量的直观性与实用性:新提出的度量方法具有更直观和更稳定的解释,特别是在处理高后验包含概率变量时,避免了DW度量的某些不一致问题。
关键信息
数据集与模型设定
- 使用了两个数据集:FLS数据集(41个潜在变量,72个国家,1960-1992年平均人均GDP增长)和DW数据集。
- 模型设定为线性回归模型,假设 $y \mid \alpha, \beta_j, \sigma \sim N(\alpha \iota_n + Z_j \beta_j, \sigma^2 I)$,其中 $Z_j$ 是包含变量子集的矩阵。
- 变量的后验包含概率通过MCMC方法进行估计,且模型空间非常庞大(如FLS数据集有 $2^{41}$ 个可能模型)。
后验包含概率分布
- 在FLS数据集中,大多数模型包含9或10个变量,且变量的后验包含概率分布不均。
- 一些变量(如1960年GDP、Confucian比例、生命期望等)具有较高的后验包含概率,而其他变量(如宗教比例、殖民历史等)包含概率较低。
联合性分析结果
- 在FLS数据集中,只有8对变量显示出联合性证据,且其中只有1对显示出“决定性”联合性(后验比超过100)。
- 联合性主要集中在包含概率较高的变量之间,而低包含概率变量更倾向于以替代方式出现。
- 对于三变量集合,82.1% 的组合显示出“决定性”替代性。
变量间的替代性分析
- 在FLS数据集中,757对变量显示出替代性证据(占92.3%),其中只有63对显示出联合性证据(即后验比大于1/3)。
- 替代性证据在低包含概率变量中更为显著,例如Civil liberties和Political rights之间显示出“决定性”替代性。
后验均值与包含概率的关系
- 变量的标准化后验均值绝对值与包含概率之间存在强正相关(0.89)。
- 这意味着高包含概率变量对经济增长的影响方向通常较为明确,而低包含概率变量可能在不同模型中具有相反的影响。
结论
- 本文提出的联合性度量方法在解释变量间依赖关系方面更具优势。
- 在经济增长回归中,高包含概率变量更倾向于联合出现,而低包含概率变量更可能以替代方式出现。
- 这些度量方法可以用于更广泛的应用,特别是在处理高维模型空间和模型不确定性时。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载