北大国发院-文本大数据分析在经济学和金融学中的应用-2018.11.15-26页_1mb
报告摘要
文本大数据分析在经济学和金融学中的应用:文献综述总结
核心内容
文本大数据分析在经济学和金融学中展现出广阔的应用前景。其核心在于利用非结构化文本数据,通过信息提取技术将其转化为结构化数据,进而用于解释或预测经济和金融现象。文本大数据具有数据来源多样化、数据体量大、时频高的特点,为研究者提供了新的视角和工具,但也带来了数据处理、信息提取和模型选择等方面的挑战。
主要观点
-
文本大数据的特征:
- 数据来源多样,包括个人、企业、媒体、政府等。
- 数据体量呈指数级增长,得益于互联网的普及。
- 数据频率高,可达秒级,适合高频分析。
-
文本信息提取步骤:
- 将原始文本库 $\Psi$ 转换为结构化数据矩阵 $\Lambda$。
- 通过统计或计量方法提取目标信息序列 $\mathbf{V}$。
- 使用提取出的 $\mathbf{V}$ 来解释或预测经济或金融现象 $Y$。
-
文本信息提取方法:
- 分词技术:包括基于字符串匹配、基于理解和基于统计的方法,常用工具包括NLPIR、中科院词法分析系统、jieba等。
- 词向量化技术:如独热表示法和词嵌入(Word Embedding),后者如Word2Vec和GloVe,能更准确地捕捉词语间的语义关系。
- 无监督学习:如词典法和主题分类模型(如LDA),用于情绪、行业分类、媒体倾向等。
- 有监督学习:如朴素贝叶斯、支持向量机(SVM)等,用于情绪识别、关注度度量等。
- 深度学习:如CNN、RNN等,具有非线性分类能力,但需要大量数据支持。
-
文本大数据在经济学中的应用:
- 经济政策不确定性指数(EPU):通过统计新闻中与经济、政策、不确定相关的词语构建,能有效度量不确定性。
- 行业分类:基于文本内容的行业分类方法,如文本网络行业分类法,能够动态反映行业边界。
- 经济周期预测:通过提取新闻文本中的情绪和主题,构建经济周期指数,可用于预测经济波动。
- 媒体政治倾向:通过分析新闻文本语言与政党语言的相似性,构建媒体政治倾向指数。
-
文本大数据在金融学中的应用:
- 关注度指数:通过统计投资者在论坛、搜索平台等的活动,构建投资者关注度指数。
- 文本情绪:使用词典法、机器学习和深度学习方法度量投资者和媒体情绪,用于分析市场行为。
- 新闻隐含波动率指数(NVIX):通过分析新闻文本与市场波动率之间的关系,构建NVIX指数,用于预测市场波动。
- 投资者分歧:通过分析文本情绪的异质性,构建投资者分歧指数,用于解释市场交易行为和价格波动。
关键信息
- 词典法:是文本情绪和不确定性分析中常用的无监督方法,但需要构建合适的词典和词语权重。
- LDA模型:用于主题分类,可以识别文本中隐藏的主题结构,但需要设定主题数量。
- SVM和深度学习方法:用于情绪识别和文本分类,能提高预测准确性,但需大量训练数据支持。
- EPU指数:由Baker等人提出,基于新闻文本构建,用于度量经济政策不确定性,已被广泛应用于国内外研究。
- NVIX指数:基于新闻文本与市场波动率之间的关系,用于预测市场波动,具有较高的时间分辨率。
- 投资者情绪:通过网络论坛、搜索行为等构建,对市场短期收益率有一定解释能力,但对未来收益率预测能力有限。
- 投资者分歧:通过分析文本情绪的分布和差异,构建分歧指数,影响市场交易行为和价格。
研究趋势与挑战
-
未来趋势:
- 更多的数据源将被引入,如政府文件、社交媒体、专利数据等。
- 文本分析方法将更加深入和广泛,包括在中文语境下的情绪构建、长文本处理等。
- 对文本信息与宏观经济、微观个体行为之间的关系研究将更加系统。
-
研究挑战:
- 文本数据的结构化转换需要高质量的处理方法。
- 提取信息的准确性依赖于词典构建、词语权重选择、模型选择等。
- 文本分析方法需要跨学科人才,包括经济学、金融学、计算机科学等。
总结
文本大数据分析正在成为经济学和金融学研究的重要工具,其在不确定性度量、情绪识别、行业分类、经济周期预测、投资者行为分析等方面展现出独特价值。尽管存在数据处理和模型构建方面的挑战,但随着技术进步和数据可得性的提升,文本大数据在实证研究中的应用将不断拓展,为研究者提供更丰富、更精准的分析手段。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载