NBER美国国民经济研究局-NBER-Testing-the-Validity-of-the-Single-Interrupted-Time-Series-Design_52页_532kb_52页_532kb
报告摘要
总结:Testing the Validity of the Single Interrupted Time Series Design
核心内容
本文探讨了单中断时间序列设计(Single Interrupted Time Series, SITS)在评估健康政策和干预措施效果时的有效性与局限性。作者通过使用俄勒冈健康保险实验(Oregon Health Insurance Experiment)的数据,对SITS方法的假设和潜在偏差进行了实证检验,并指出SITS方法在实践中可能产生误导性结果,特别是在没有随机对照组的情况下。
主要观点
- SITS方法的流行:SITS是一种常用的准实验设计,尤其适用于无法进行随机对照试验(RCT)的场景。它利用干预前的纵向数据构建一个反事实趋势,从而估计干预效果。
- SITS的假设与局限:SITS的有效性依赖于若干关键假设,包括干预前后的趋势一致性、干预前的线性趋势可被合理外推等。然而,这些假设在现实中可能被违反,导致估计偏差。
- SITS的潜在偏差来源:
- 同期变化(Concurrent Changes):干预实施期间发生的其他变化可能混淆真实干预效果,例如经济衰退、测量方式改变等。
- 干预前趋势变化(Differential Pre-Period Changes):干预前的某些变化可能与干预本身相关,从而影响趋势估计,例如“预期效应”(anticipation effects)。
- 实证检验:作者使用俄勒冈健康保险实验中的治疗组数据构建SITS估计,并将其与RCT结果进行比较,发现SITS估计与RCT结果方向相反,且显著性较强,表明SITS可能无法准确反映真实效果。
- 内部效度的威胁:SITS设计容易受到历史、选择和测量方式变化等内部效度威胁的影响,导致估计不准确。
关键信息
1. SITS设计的结构
- 单位是等间隔的时间单位(如天、周)。
- 使用线性回归模型来估计干预前后的趋势变化。
- 模型公式如下:
$$
Y _ {t} = \beta_ {0} + \beta_ {1} \text {time} _ {t} + \beta_ {2} \text {post} _ {t} + \beta_ {3} \text {time post} _ {t} + u _ {t}
$$
$$
u _ {t} = \rho u _ {t - k} + z _ {t}
$$
- 其中,$\beta_2$ 表示干预后的水平变化,$\beta_3$ 表示干预后的趋势变化。
- 误差项使用Newey-West标准误以处理自相关问题。
2. SITS的假设
- 假设1:干预前的水平和趋势在治疗组和对照组之间是相同的。
- 假设2:在没有干预的情况下,干预后的趋势与干预前的趋势外推一致。
- 假设3:干预前后的趋势可以用线性组合参数表示。
3. 内部效度的威胁
- 同期变化:干预实施期间发生的其他变化(如政策调整、经济波动)可能导致结果偏差。
- 预期效应:参与者可能因预期干预而改变行为,从而影响干预前后的趋势。
- Ashenfelter's Dip:在某些情况下,参与者可能在干预前已经表现出不同的趋势(如失业者在就业培训项目启动前收入下降),导致SITS估计偏差。
4. 实证发现
- 在俄勒冈健康保险实验中,SITS估计显示急诊服务使用率显著下降,而RCT显示使用率显著上升,方向相反。
- SITS估计结果在多种方法下仍稳健,说明其偏差并非偶然。
- 这一结果表明SITS方法在某些情境下可能低估或高估干预效果,甚至误导政策决策。
5. 一致性度量(Concordance Metric)
- 作者提出使用统计显著性与实际意义来判断SITS与RCT结果是否一致。
- 若两者差异显著且实际意义重大,则认为SITS设计与RCT设计存在不一致(discordant)。
- 若差异显著但实际意义不大,则认为SITS设计具有一定的可靠性,但需谨慎对待。
结论
- SITS方法在缺乏对照组的情况下,容易受到多种内部效度威胁的影响,其结果可能误导研究者和政策制定者。
- 作者建议在使用SITS时,应充分考虑潜在偏差来源,并结合其他方法(如RCT)进行交叉验证。
- 尽管SITS在某些情况下仍可提供有价值的信息,但其有效性有限,尤其在涉及复杂社会和健康干预时。
附录:SITS的统计显著性检验方法
- 使用**自助法(bootstrapping)**来计算差异的统计显著性。
- 步骤包括:
- 从RCT数据集中抽样(有放回)生成一个与原始数据集大小相同的样本;
- 估计该样本的处理效应;
- 从准实验数据集中同样抽样并估计处理效应;
- 计算两个估计值的差异;
- 重复上述步骤1000次,计算差异的标准差作为标准误;
- 使用t检验判断差异是否具有统计显著性。
参考文献
- 本文引用了大量关于准实验设计和因果推断的文献,包括LaLonde (1986)、Bloom (2003)、Shadish, Cook, & Campbell (2002) 等研究。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载