机器学习白皮书系列之四:机器学习流程和算法介绍及金融领域应用实例-20180207-长江证券-32页-1mb
报告摘要
机器学习流程和算法介绍及金融领域应用实例总结
核心内容概述
本文主要介绍机器学习的基本流程和相关算法,并结合金融领域的实际应用,特别是多因子选股模型,说明如何通过特征工程、模型训练和模型融合来构建更优的预测模型。核心内容包括机器学习的三大步骤、特征工程的具体方法、模型训练中的关键算法、模型融合策略,以及多因子选股案例的分析。
主要观点与关键信息
1. 机器学习问题与流程
- 机器学习问题本质:寻找最优的建模流程以最小化经验风险泛函(样本误差)。
- 机器学习流程:包括特征工程、模型训练和模型融合。
- “方差”与“偏差”:样本误差可分解为“方差”和“偏差”两个部分,二者存在制衡关系,需找到一个平衡点以达到最优预测效果。
2. 特征工程
- 特征工程的三大步骤:特征构建、特征提取、特征选择。
- 特征构建:
- 包括对文本、图像、日期、地理位置、类别变量、噪音数据等的处理方法。
- 例如:文本数据使用分词和 word2vec,图像数据使用卷积、池化,日期数据提取年月日等。
- 特征提取:
- 包括对低阶特征的组合、变换,以及无监督降维方法(如 PCA、ICA、RBM)。
- 特征选择:
- 分为过滤式、封装式和嵌入式三种方法。
- 过滤式:基于数据本身的特性,如相关系数、信息熵等,算法简单但精确度低。
- 封装式:通过模型训练来评估特征子空间,效果更好但计算成本高。
- 嵌入式:将特征选择嵌入到模型训练过程中,如 Lasso 回归和树模型的剪枝方法。
3. 模型训练
- 模型分类:
- 线性模型:如线性回归、Lasso、Ridge、逻辑回归等,适用于线性关系的建模。
- 树模型:如决策树、随机森林、Extra Trees、Adaboost、GBDT 等,适用于非线性关系的建模。
- 深度学习模型:如 DNN、CNN、RNN 等,适用于复杂数据(如图像、文本)的建模。
- 优化算法:
- 包括 SGD、Adagrad、Adadelta、RMSprop、Adam 等。
- Adam 是当前最流行的优化算法,结合了动量项和自适应学习率调整,适用于大数据和高维空间。
- 参数训练:
- 优化算法的两个关键参数为 batch size 和 epoch,需根据数据规模和训练效率进行调整。
4. 模型融合
- 模型融合的两种方式:
- 横向拼接:将多个模型的输出进行加权平均,以降低“方差”。
- 纵向拼接:将多个模型的输出作为下一层模型的输入,形成多层结构。
- 融合模型要求:
- 模型表现好、模型之间相关性低。
- 深度学习模型可以将融合过程整合进网络结构中,通过参数优化实现模型融合。
- 常用融合方法:
- Blending:使用部分数据训练第一层模型,另一部分数据用于第二层训练。
- Stacking:通过交叉验证思想,对数据进行更充分的利用,提高模型稳定性。
- Bagging/Boosting:集成方法,如随机森林和 GBDT,也是模型融合的实现方式之一。
5. 多因子选股案例
- 建模流程:
- 使用 提升树模型、ExtraTrees 模型 和 深度神经网络模型 进行横向拼接。
- 对模型输出的伪概率进行加权平均,构建投资组合。
- 数据与特征工程:
- 股票池为全部 A 股,剔除 ST 股票、上市不足一年的股票、停牌时间超过 10 个交易日的股票。
- 特征提取基于每月最后一个交易日的因子数据,对涨跌幅进行排序,取前 40% 作为正样本,后 40% 作为负样本。
- 对因子进行中位数去极值、缺失值处理、标准化处理。
- 模型表现:
- 融合模型在 超额年化收益、夏普比率、信息比率 和 月度超额胜率 上表现略优于单个模型。
- 在分组投资组合的区分上更为明显,说明融合模型具备更好的预测能力和稳定性。
金融领域应用实例
- 多因子选股模型中,单个模型通常基于整个特征空间进行预测,容易出现函数空间不一致的问题。
- 融合模型通过在大函数空间中选择多个小函数空间进行合并,提高模型的准确性和稳定性。
- 本文中融合模型的超额年化收益为 25.91%,夏普比为 1.06,信息比为 2.26,月度超额胜率为 0.76,表现优于单个模型。
关键算法对比
| 类型 | 方法 | 优点 | 缺点 |
|---|---|---|---|
| 线性模型 | 普通线性回归、Lasso、Ridge、逻辑回归 | 简单高效,适用于线性关系 | 欠拟合,对非线性关系处理能力有限 |
| 树模型 | 决策树、随机森林、Extra Trees、Adaboost、GBDT | 捕捉非线性关系,可处理高维数据 | 容易过拟合,无法并行训练 |
| 深度学习模型 | DNN、CNN、RNN | 处理非结构化数据能力强,自适应学习 | 参数优化复杂,模型设计难度大 |
优化算法对比
| 算法 | 适用场景 | 优点 | 缺点 |
|---|---|---|---|
| SGD | 一般场景 | 简单高效 | 易收敛到局部最优 |
| Adam | 大数据、高维 | 自适应学习率,训练稳定 | 需要合理初始化 |
| RMSprop | RNN | 处理非平稳目标 | 依赖全局学习率 |
| Adagrad/Adadelta | 稀疏数据、非平稳目标 | 自适应调整学习率 | 后期训练可能提前结束 |
总结
本文系统介绍了机器学习的基本流程、关键算法及其在金融领域的应用,特别强调了特征工程、模型训练和模型融合在建模过程中的重要性。在金融领域,多因子选股模型通过融合多个模型的结果,提高了预测的准确性和稳定性。此外,还介绍了当前主流的优化算法,如 SGD、Adam、RMSprop 等,并通过对比分析了不同模型和算法的优缺点。深度学习模型在处理非结构化数据方面具有优势,但其参数优化和模型设计较为复杂,需结合实际场景进行选择。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载