20211213-中国银河-海外文献-7基于Tweet的舆情交易策略_用社交媒体文本挖掘和稀疏矩阵分解预测股市波动_18页_1mb
报告摘要
文献总结:基于Tweet的舆情交易策略:用社交媒体文本挖掘和稀疏矩阵分解预测股市波动
核心内容
本文探讨了如何利用社交媒体文本信息,特别是StockTwits上的用户发帖数据,结合稀疏矩阵分解(SMF)方法,预测股市波动。研究重点在于构建一个基于文本挖掘的股价预测模型,并通过样本内和样本外测试,验证该模型的有效性。最终,作者提出了一种基于预测结果的交易策略,该策略在收益率和夏普比率方面优于基准投资组合。
主要观点
-
社交媒体作为市场预测数据源
社交媒体数据,尤其是StockTwits,已成为一种流行的市场预测数据源。它提供大量实时、高频的财经信息,相较于传统新闻媒体,具有更广泛的覆盖和更即时的反馈。 -
文本挖掘与稀疏矩阵分解(SMF)
本文采用Wong等人(2014)提出的潜空间模型(SMF),将股票价格与文本数据相关联。与以往研究不同,本文不进行情绪评估,而是专注于词频与市场指标的联系,以避免情绪分类带来的误差。 -
预测模型的构建与优化
文本数据经过预处理,包括去除停用词、链接、表情符号等非相关内容,并采用词频加权方案进行标准化处理。通过稀疏群Lasso回归方法,进一步限制模型的复杂度,提高预测的稳定性。 -
交易策略的提出
基于预测结果,作者提出了一种交易策略,即根据模型预测的涨跌方向,平均投资于预期会上涨的股票,并在交易日结束时卖出。该策略在样本外测试中表现出优于基准的夏普比率和收益率。 -
模型有效性分析
模型在样本内测试中,对股票价格运动方向的预测准确率为70.12%;样本外测试中,预测准确率在51.18%至51.58%之间。尽管日内预测的准确率低于每日预测,但整体上仍优于随机预测。
关键信息
- 数据来源:StockTwits上2011年1月1日至2015年8月31日的约4500万条用户发帖数据,以及S&P500指数成分股的股价数据。
- 模型方法:基于稀疏矩阵分解的文本挖掘方法,将文本信息映射到潜在因子空间,并通过词频加权和稀疏性约束优化模型。
- 模型表现:
- 样本内预测准确率:70.12%
- 样本外预测准确率:51.18%(2013年)至51.58%(2015年)
- 夏普比率(SR):1.35,显著高于市场ETF的SR(0.97-0.98)
- 年化收益率:1.18%,优于大多数ETF表现
- 交易策略:
- 每日重复投资于预测会上涨的股票
- 通过模型预测的准确率提升策略表现
- 与等权重(EW)和最小方差(GMV)策略相比,表现更优
方法概述
-
文本挖掘:
- 提取StockTwits文本数据,去除非相关内容
- 标准化词频数据,采用z-score方法
- 使用Salton & Buckley(1988)的词频加权方案
-
稀疏矩阵分解:
- 构建一个潜在因子空间,将文本和股票映射到该空间
- 引入稀疏性限制,以减少模型过拟合
- 使用交替方向乘子法(ADMM)求解模型
-
训练与预测:
- 数据集分为训练集、验证集和测试集
- 每日预测和日内预测方法一致
- 通过历史数据预测未来股价走势
结果分析
-
样本内结果:
- 模型预测准确率高达70.12%
- 精度和召回率分别为68.93%和75.05%
- 与基准模型相比,表现更优
-
样本外结果:
- 每日预测准确率在51.18%至51.58%之间
- 日内预测准确率较低,有时甚至低于随机预测
- 夏普比率在样本外测试中达到1.35,优于市场ETF
-
交易策略表现:
- 累计收益率:1.55%
- 年化收益率:1.18%
- 夏普比率:1.35
- 与等权重(EW)和最小方差(GMV)策略相比,表现更优
风险提示
- 本研究基于历史数据,不能保证未来市场表现
- 模型未考虑交易成本,实际应用中需考虑
- 无风险利率假设为零,实际市场情况可能不同
- StockTwits信息可能包含非原创内容,影响预测效果
相关研究
- 《海外文献-1基于谷歌趋势的量化交易》
- 《海外文献-2社交媒体胜过新闻吗》
- 《海外文献-3 Google趋势搜索可否被用于分散风险?》
- 《海外文献-4 通过量化维基百科的使用模式预测股市变动》
- 《海外文献-5量化财经新闻与股市的关系》
- 《海外文献-6 Twitter情绪指数能用于预测加密货币走势吗》
附录信息
- 作者:吴俊鹏
- 联系方式:010-80927631 / wujunpeng@chinastock.com.cn
- 分析师登记编码:S0130517090001
- 评级标准:
- 推荐:公司股价超越分析师平均回报20%及以上
- 谨慎推荐:公司股价超越分析师平均回报10%-20%
- 中性:公司股价与分析师平均回报相当
- 回避:公司股价低于分析师平均回报10%及以上
- 免责声明:
- 本报告仅供参考,不构成投资建议
- 银河证券不对因使用本报告而造成的损失负责
- 报告内容可能根据市场变化而更新,不保证其准确性或完整性
图表说明
- 图1:展示“oil”和“aapl”词频与价格随时间的变化趋势
- 图2:展示StockTwits上词频随时间的增长趋势
- 图3:展示标准化后的词频分布
- 图4:样本内预测准确率随日期的变化
- 图5:不同投资组合的表现对比
- 图6:预测准确率与收益率大小的正相关关系
表格说明
- 表1:样本内与样本外预测准确率对比
- 表2:模型准确率与基本模型的对比
- 表3:市场时机模型与ETF的夏普比率对比
- 表4:不同投资组合的绩效对比
结论
本文提出了一种基于StockTwits文本数据的股市预测模型,通过稀疏矩阵分解方法,成功构建了一个具有较高预测准确率和夏普比率的交易策略。尽管日内预测效果不如每日预测,但整体策略表现优于市场基准。研究强调了社交媒体数据在金融市场预测中的潜力,同时提醒投资者注意模型的局限性及实际应用中的风险因素。
试读结束,高清完整版pdf/doc/ppt,请点下载