20210326-华泰期货-金融科技赋能投研系列之十三_Autoencoder与金融数据应用_10页_812kb
报告摘要
金融科技赋能投研系列之十三:Autoencoder 与金融数据应用总结
核心内容
本文探讨了如何将自编码器(Autoencoder)这一无监督学习算法应用于金融数据分析,旨在识别金融时间序列数据中的主导影响维度,为量化投研模型提供数据支持。文章结合了传统经验动力学模型(EDM)与新兴AI技术,分析了其在金融数据处理中的适用性与优势。
主要观点
1. 金融数据分析的挑战
- 金融市场是一个开放性系统,受内外部因素影响,且这些因素的强弱具有不连贯性。
- 传统数据分析方法(如多因子模型)在处理金融数据时面临“维数诅咒”和非线性处理能力不足的问题。
- 金融数据通常具有低信噪比,传统模型难以在真实市场中有效提取信息。
2. AI技术的优势
- AI模型(如浅度学习和深度学习)具备处理复杂非线性问题的能力。
- AI技术能够处理大量数据,且通过模型设计规避多重共线性和因子过多的问题。
- 无监督学习方法(如Autoencoder)能够自动发现金融数据中的隐含规律,无需预设标记。
3. Autoencoder的应用
- Autoencoder通过编码-解码机制实现数据降维,保留关键特征。
- 在处理时间序列数据时,使用LSTM层构建编码器和解码器,并结合方差均值和“最近假邻居”(FNN)正则项优化模型。
- 编码节点的方差排序用于识别活跃维度,方差骤降前的维度被认为是主要的市场驱动因素。
4. EDM方法的对比
- EDM是一种非参数模型,基于Takens定理,通过收敛交叉映射方法确定相空间维度。
- EDM方法在金融数据中表现出较高的活跃维度数,但Autoencoder在抗噪能力方面表现更优。
关键信息
1. 测试数据与环境
- 测试数据为国内金融期货合约的主力与次主力连续合约,时间跨度从2000年至2021年。
- 数据采样频率为日度。
- 使用Tensorflow 4.2和Keras 2.3.0.0作为AI工具包。
2. 维度判定标准
- 方差占比:最活跃维度的方差占比需超过总方差的90%。
- 特征值占比:最活跃维度的特征值占比需超过总特征值的99%。
- EDM维度:通过预测值与真值的相关性判断活跃维度。
3. 测试结果概览
| 品种 | 主力/短周期 | 方差占比 | 方差判定维度 | 特征值占比 | 特征值判定维度 | EDM维度 |
|---|---|---|---|---|---|---|
| IF | 主力 | 99.6% | 3 | 99.5% | 2 | 3 |
| CU | 主力 | 96.4% | 3 | 99.9% | 4 | 3 |
| M | 主力 | 99.1% | 3 | 99.1% | 2 | 3 |
| CF | 主力 | 99.5% | 3 | 99.9% | 3 | 3 |
| 品种 | 次主力/短周期 | 方差占比 | 方差判定维度 | 特征值占比 | 特征值判定维度 | EDM维度 |
|---|---|---|---|---|---|---|
| IF | 次主力 | 97.5% | 3 | 99.74% | 3 | 3 |
| CU | 次主力 | 93.5% | 3 | 99.60% | 3 | 3 |
| M | 次主力 | 99.3% | 4 | 99.99% | 3 | 3 |
| CF | 次主力 | 99.7% | 2 | 99.75% | 2 | 3 |
4. 主要发现
- 不同品种在不同周期上表现出低维度特征,与传统多因子模型的高维设定形成对比。
- 自编码器在处理金融时间序列数据时,表现出较好的抗噪能力,尤其在长周期数据中。
- 金融数据的活跃维度与市场风格因子的切换密切相关,模型能够识别出关键的市场驱动因素。
未来研究方向
- 持续探索无监督学习模型在金融领域的应用,如因子挖掘与合成。
- 结合监督学习模型(如随机森林、XGBoost、LSTM等)进行模型整合与优化。
- 深入研究不同金融工具在不同市场环境下的维度变化,提升模型的适应性与预测能力。
参考文献
- [1] 华泰期货量化策略年报 20201207:金融科技赋能投研系列之十一、十二:智AI科技慧投未(上,下)
- [2] 华泰期货金融时序专题:金融科技赋能投研系列之(二至八)
- [3] William Gilpin, “Deep reconstruction of strange attractors from time series”, arXiv: 2002.05909, (2020)
- [4] Floris Takens, “Detecting strange attractors in turbulence”, Dynamical Systems and Turbulence, Lecture Notes in Mathematics, vol. 898. Springer-Verlag. pp. 366 - 381, (1981)
- [5] G. Sugihara, and R.M. May, “Nonlinear forecasting as a way of distinguishing chaos from measurement error in time series” Nature, 344:734-741 (1990)
- [6] G. Sugihara, “Nonlinear forecasting for the classification of natural time series”, Philosophical Transactions of the Royal Society of London: Mathematical, Physical and Engineering Sciences 348: 477-495 (1994)
免责声明
- 本报告基于公开信息编制,不保证其准确性或完整性。
- 投资者应自行判断,不依赖本报告进行投资决策。
- 本报告版权归属华泰期货研究院,未经许可不得擅自使用或传播。
联系方式
- 投资咨询业务资格:证监许可【2011】1289号
- 研究院 量化组
- 陈辰:0755-23887993 / chenchen@htfc.com / 从业资格号:F3024056 / 投资咨询号:Z0014257
- 何绪纲:0755-23887993 / hexugang@htfc.com / 从业资格号:F3069194
- 镇谌博:0755-23887993 / zhenchenbo@htfc.com / 从业资格号:F3080231
公司信息
- 公司总部:广东省广州市越秀区东风东路761号丽丰大厦20层
- 电话:400-6280-888
- 网址:www.htfc.com
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载