美联储-全面召回_大型语言模型的宏观经济知识评价(英)-2025.6_48页_1mb
报告摘要
总结:
-
LLM 的宏观经济数据记忆能力:
Laureate 语言模型(Claude Sonnet 3.5)在部分宏观经济数据(如 CPI 和失业率)上的回忆准确,尤其适用于二战后至今的数据,但对高波动的经济活动数据(如 GDP 和工业生产的增长)的记忆较为不精确,无法准确捕捉高频波动。数据修订融合的问题也日益显著。 -
历史记忆与数据污染:
回顾历史时,LLMs 的记忆表现优异,但数据偏差(look-ahead bias)会随历史时间的延长而加大。模型在估计中有时会混杂初版数据与后续修订版数据,导致回忆中的“平滑”效应。这种污染限制了模型作为实时预测者的适用性。 -
预测性能:
不考虑污染时,LLMs 的预测能力与 SPM(专业调查员)模型相比并不逊色,但存在数据污染问题。即使模型遵循限制(如仅使用历史信息),其预测仍可能引入未来数据,影响准确性。 -
数据发布的回忆:
LLMs 在回忆经济数据发布日期时,虽有时准确,但也频繁出现“提前告知”(look-ahead bias)和“过时数据偏见”(look-behind bias),但通过恰当提示工程,可将偏差最小化。
结论:
LLMs 在部分宏观经济数据的回顾方面表现出色,但用于预测和历史分析存在数据污染的问题,进而影响其实际应用,尤其在模拟实时预测者时,局限性尤为明显。因此,在应用 LLMs 于经济分析时,需谨慎考虑数据泄露风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载