人工智能系列之六:人工智能选股之Boosting模型-20170911-华泰证券-41页-2mb
报告摘要
金工研究:Boosting集成学习模型在多因子选股中的应用
核心内容概述
本报告探讨了Boosting集成学习模型在多因子选股中的应用,重点分析了AdaBoost、GBDT和XGBoost三种模型的性能表现及其在多因子选股策略中的效果。报告通过7阶段滚动回测方法对模型进行了系统测试,并基于正确率、AUC值、年化收益率、信息比率、最大回撤等指标对模型进行了综合评估。
主要观点
- Boosting模型通过串行方式结合多个弱学习器,能够更好地控制模型的偏差和方差,相较于Bagging模型(如随机森林)更简单。
- XGBoost作为Boosting算法的高效实现,相比AdaBoost和GBDT在预测能力和运算速度上具有明显优势,同时具备较好的参数优化特性。
- XGBoost在多因子选股中的表现优于线性回归模型,尤其在沪深300和中证500成分股内的行业中性策略中,XGBoost表现出更高的超额收益和信息比率。
- 模型测试结果显示,XGBoost在样本外的AUC值和正确率均优于AdaBoost和GBDT,且运行速度更快。
关键信息
一、Boosting模型的构建流程
- 特征和标签提取:使用70个因子暴露度作为特征,以沪深300指数为基准计算个股超额收益作为标签。
- 特征预处理:包括中位数去极值、缺失值处理、行业市值中性化和标准化。
- 训练与评估:采用7阶段滚动回测方法,以正确率、AUC、年化收益率、信息比率、最大回撤等指标评估模型。
二、模型测试结果
- XGBoost分类模型在沪深300成分股内行业中性策略中,超额收益为6.4%,信息比率为1.78;在中证500成分股内行业中性策略中,超额收益为7.2%,信息比率为2.03;在全A行业中性策略中,超额收益为31.5%,信息比率为4.4。
- 模型比较:
- AdaBoost、GBDT、XGBoost样本外平均AUC分别为0.5695、0.5699、0.5696。
- 样本外平均正确率分别为53.94%、54.12%、54.02%。
- XGBoost在运算速度上有明显优势,训练时间比其他模型快2~8倍。
- 三种模型在样本外AUC值和正确率上表现相近,但XGBoost在策略收益上更优。
三、模型的决策树结构分析
- 所有模型均使用CART决策树,最大深度设为3。
- 第一个决策树的划分均以
exp_wgt_return_3m(3个月改进的动量反转因子)为主,说明该因子对模型结果影响较大。 - 共同选中的因子包括
turn_1m(一个月日均换手率)和ln_capital(对数市值)。 - GBDT和XGBoost的划分因子相同,但划分值不同,这表明XGBoost在实现上更高效。
四、XGBoost因子特征重要性
- XGBoost分类模型可以导出因子重要性评分,有助于识别模型主要依赖的因子。
- 特征重要性评分前40名中,市值相关因子
ln_capital排名第一,情绪因子rating_change排名第二,波动率因子std_FF3factor_1m排名第三。 - 不同年份的因子重要性略有变化,但市值和情绪因子始终是主要影响因素。
五、模型运行速度与选股效果
- XGBoost在运行速度上远优于AdaBoost和GBDT,尤其在处理大量数据时表现突出。
- 在不同股票池(沪深300、中证500、全A)中,XGBoost均能稳定地提高超额收益和信息比率。
- 最大回撤方面,XGBoost相比线性回归没有明显优势。
结论与展望
XGBoost在多因子选股中表现出优越的性能,其在预测能力和运行速度上的优势使其成为当前Boosting集成学习领域的重要工具。尽管其在最大回撤方面与线性回归模型表现相似,但在其他指标上均优于传统模型。未来可以进一步优化模型参数,提升其在不同市场环境下的适应能力,并探索其在更多因子组合中的表现。
风险提示
通过Boosting集成学习模型构建选股策略是基于历史数据的经验总结,存在模型失效的风险。投资者需谨慎评估模型在不同市场条件下的适用性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载