20260909-国金证券-大模型赋能投研系列之三十一_GPT-6_Astra金融测评_投研任务提升明显_35页_5mb
报告摘要
金融工程组报告:GPT-6 Astra 金融测评总结
核心内容概述
本报告对 GPT-6 Astra 进行了金融投研任务测评,将其与 GPT-5.6 Sol、Kimi K3、GLM-5.3 和 DeepSeek V4 Pro 进行对比分析。评测围绕估值建模、多因子回测和行业研究三个真实投研任务展开,全面检验模型在复杂任务执行、成果交付、结果可复核性及模型质量等方面的表现。GPT-6 Astra 在三项任务中均排名第一,展现出更强的复杂工作流处理能力、更完整的财务模型构建和更清晰的研究闭环。
主要观点与关键信息
1. GPT-6 Astra 的能力提升
- 重点方向:本轮升级主要强化了计算机操作、自动化执行和复杂多步骤任务能力,强调从需求理解到成果交付的完整流程。
- 工具支持:支持网页搜索、文件搜索、代码解释器、托管终端等工具,适用于金融投研中的长流程任务。
- 模型表现:在 OSWorld 2.0、ScreenSpot-Pro、AutomationBench 等测试中表现突出,提升了任务执行效率和准确性。
2. GPT-6 Astra 与 GPT-5.6 Sol 对比
- GPT-6 Astra 在计算机使用、复杂任务处理和长上下文能力上明显优于 GPT-5.6 Sol。
- GPT-6 Astra 在 OSWorld 2.0 中完成任务耗时减少 47%,执行效率提升显著。
3. 五款模型的公开规格与 API 价格
- 上下文与输出:均支持约百万 Token 上下文,GPT-6 Astra 输出能力最高,达到 128K Token。
- 价格:GPT-6 Astra 的 API 价格明显高于其他模型,输入 10 美元/百万 Token,输出 50 美元/百万 Token。
- 成本对比:GPT-5.6 Sol 最低,GLM-5.3 和 DeepSeek V4 Pro 价格更具竞争力。
4. 金融投研任务表现
4.1 估值任务
- 任务要求:建立完整的财务预测模型、估值模型和投资分析报告,要求公式关联、数据可追溯、模型可复算。
- 模型表现:
- GPT-6 Astra:表现最佳,经营拆解、现金流分析和底稿质量最佳。
- GLM-5.3:排名第二,具备较好的可重算性,但部分参数仍需人工复核。
- GPT-5.6 Sol:排名第三,模型规范性强,但经营假设深度不足。
- Kimi K3:排名第四,报告逻辑自洽,但模型联动和公式可靠性不足。
- DeepSeek V4 Pro:排名第五,报告结构完整但存在系统性公式错位,底稿不可复算。
4.2 回测任务
- 任务要求:基于沪深 300 历史成分股构建多因子模型,处理交易约束、停牌、涨停跌停、数据缺失等。
- 模型表现:
- GPT-6 Astra:表现最佳,处理历史成分股、财务披露时点、信号与执行日、交易成本等,回测逻辑完整。
- GPT-5.6 Sol:排名第三,交易时点处理较规范,但未计入交易成本。
- Kimi K3:排名第四,交付较完整,但交易约束处理不足。
- GLM-5.3:排名第二,具备较好的数据链和纠错机制,但未充分处理交易成本和不可交易状态。
- DeepSeek V4 Pro:排名第五,报告结构完整但存在系统性公式错误,影响模型执行和结果复核。
4.3 行业研究任务
- 任务要求:完成行业深度报告,包括公司与来源覆盖、投资框架、Wiki 关联和质量检查。
- 模型表现:
- GPT-6 Astra:表现最佳,公司与来源覆盖全面,投资框架清晰,Wiki 知识库完善。
- GLM-5.3:排名第二,公司和数据覆盖广,但部分投资框架和来源沉淀不足。
- DeepSeek V4 Pro:排名第三,来源治理较规范,但投资框架和 Wiki 信息较为有限。
- GPT-5.6 Sol:排名第四,报告框架完整,但 Wiki 实体和来源沉淀不足。
- Kimi K3:排名第五,报告结构完整,但投资框架和来源治理较弱。
总结
- GPT-6 Astra 在复杂任务执行、研究闭环和成果交付方面表现突出,尤其在估值建模和回测任务中领先。
- 与其他模型相比,其更高的价格是否合理取决于能否显著提升任务完成度、底稿质量和成果稳定性。
- GPT-6 Astra 的交付成果具备较好的可调整性和可复核性,但需注意其对底层经营变量的依赖。
- GLM-5.3 在可重算性和数据完整性方面表现优秀,但部分参数仍需人工判断。
- Kimi K3 和 DeepSeek V4 Pro 在报告结构和逻辑上表现尚可,但在模型执行和数据处理上存在明显短板。
- GPT-5.6 Sol 在模型规范性和交易时点处理上表现良好,但交易成本和不可交易状态处理不足。
风险提示
- 模型结果基于历史数据,不能代表未来。
- 市场环境变化可能导致模型失效。
- 交易成本或其他条件变化可能影响策略收益。
- 大模型输出存在随机性和准确性风险。
- 投资建议基于提示词生成,可能随提示词变化而变化。
- 使用 AI 生成内容需注意版权和法律问题,用户需自行承担相关风险和后果。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载