20260706-中国银河-银河金工组合优化系列报告_基于深度学习预测与强化学习优化的指数增强策略_34页_3mb
报告摘要
基于深度学习预测与强化学习优化的指数增强策略总结
核心内容
本文提出了一种结合深度学习预测与强化学习优化的指数增强策略框架,旨在通过动态决策实现收益风险信号预测和个股权重配置。该框架将指数增强问题拆分为八个连续环节,包括数据输入、清洗、特征工程、时序编码、截面关系聚合、多标签预测、强化学习组合优化以及回测评估。
主要观点
- 深度学习预测:利用 TimeEncoder-GraphSAGE-MLP 三层模型对个股的收益与风险信号进行预测,形成未来收益风险的预测信号。
- 强化学习优化:将组合管理视为序列决策问题,通过 PPO 模型进行动态权重调整,结合 Banach 自融资投影,实现目标权重与组合价值的自洽。
- PPO 模型:采用 Actor-Critic 架构,通过裁剪目标函数限制策略更新幅度,提升训练稳定性。模型采用逐年滚动训练方式,并通过双窗口+双门槛机制筛选优质模型。
- Banach 不动点迭代:用于调整组合规模,确保交易成本与组合价值一致,避免资金不自洽问题。
- 奖励函数设计:综合考虑超额收益、因子暴露、跟踪误差惩罚、换手惩罚与集中度惩罚,实现收益与风险的平衡。
- 策略表现:在沪深300与科创50指数增强策略中,该框架表现优于传统凸优化方法,有效控制回撤并提高超额收益。
关键信息
1. 策略框架流程
- 原始数据输入
- 数据清洗与标签构造
- K线衍生特征工程
- 时序编码
- 截面关系聚合
- 多标签预测(如 Sharpe 比率、最大回撤)
- 强化学习组合优化
- 回测与评估
2. 状态空间设计
状态空间包括:
- 收益信号 $f_t$
- 风险信号 $z_t$
- 基准权重 $w_t^b$
- 上一期主动偏离 $d_{t-1}$
- 回溯窗口内收益与风险信号均值
- 组合特征与市场环境特征(如总资产、换手率、跟踪误差等)
3. 动作空间与目标权重生成
- 动作空间为连续权重调整信号,经 Clip 裁剪与 Softmax 映射后生成可执行的主动配置权重。
- 最终目标权重由基准权重与主动权重按主动比例加权归一化得到。
4. 奖励函数
奖励函数由以下部分组成:
- 实际超额收益 $ER_t$
- 收益信号排名暴露 $FR_t$
- 风险惩罚 $RP_t$
- 跟踪误差惩罚 $TEP_t$
- 换手惩罚 $TOP_t$
- 可选集中度惩罚 $CP_t$
5. PPO 模型训练与筛选
- 训练集与测试集划分:沪深300 采用最近 4 年数据为训练集,1 年为验证集,未来 1 年为测试集;科创50 采用最近 3 年数据为训练集,1 年为验证集,未来 1 年为测试集。
- 质量诊断机制:采用双窗口+双门槛方式,综合平均奖励与累计超额收益筛选模型。
- 重试机制:设置 5 个随机数种子区间,每个区间最多重试 3 次,对候选模型进行 Softmax 加权集成。
6. Banach 不动点迭代
- 用于调整组合规模,确保目标权重与组合价值自洽。
- 当前训练阶段默认交易成本为 0,回测阶段统一扣除真实交易成本。
7. 策略表现
-
沪深300指数增强策略:
- 年化收益率:5.11%
- 年化超额收益:4.26%
- 最大回撤:-30.23%(策略) vs -45.60%(指数)
- 跟踪误差:17.60%
- 换手率:379.97%(2026)
-
科创50指数增强策略:
- 年化收益率:15.09%
- 年化超额收益:12.52%
- 最大回撤:-53.80%(策略) vs -59.96%(指数)
- 跟踪误差:31.03%
- 换手率:282.68%(2026)
8. 强化学习有效性检验
- 消融实验:通过移除不同约束项,验证其对策略表现的影响。
- 完整奖励函数组表现最佳,累计超额收益达 83.76%
- 去除实际超额收益项后,累计超额收益最低,仅为 5.85%
- 去除 Alpha 信号、风险惩罚和 TE/换手约束后,累计超额收益显著下降。
- pipeline 筛选结果:虽然累计超额收益略低于完整奖励函数组,但主动权重配置更优,且换手率更低,表现出更好的实际应用效果。
回测结果对比
- 沪深300:强化学习策略在 2023 年上半年表现优于凸优化,但 2023 年下半年以来有所跑输,尤其在 2025 年 6-9 月。
- 科创50:强化学习策略整体表现优于凸优化,尤其在 2024 年以来超额收益明显。
- 回撤控制:强化学习策略在回撤控制方面优于凸优化,特别是在 2023 年与 2025 年。
风险提示
- 报告结论基于历史数据和统计规律,但市场走势可能受政策、市场环境等不可预测因素影响,无法保证未来表现。
- 基金历史收益不代表未来业绩,文中观点仅供参考,不构成投资建议。
附录
- 可调参数:包括温度参数、换手成本率、训练轮次等。
- 状态空间变量:涵盖收益风险信号、持仓位置、交易约束、市场环境等。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载