20260816-国金证券-大模型赋能投研系列之二十八_DeepSeek_V4_Pro金融投研能力评测_27页_4mb
报告摘要
DeepSeek V4 Pro 金融投研能力评测总结
核心内容概述
本报告对 DeepSeek V4 Pro、Kimi K3 和 GLM-5.2 三款模型在金融投研任务中的表现进行了评测,重点考察估值建模、多因子回测和行业研究三项任务。评测结果显示,DeepSeek V4 Pro 在 Agent 能力、API 价格和 Harness 架构上实现了显著提升,但各模型在实际任务执行中仍存在一定的差距。
主要观点
-
DeepSeek V4 Pro 的能力跃升
- 采用 MoE 架构,总参数 1.6T,单 Token 激活参数 49B,支持 100 万 Token 上下文。
- 在多个 Agent 基准测试中表现优异,例如 HLE、TerminalBench、DeepSWE、Toolathlon-Verified 和 AutomationBench,分别提升 24.5%、21.9%、389.8%、32.6% 和 148.4%。
- 支持多种接口(Chat Completions、Responses、Anthropic)和三档思考强度(low、high、max),满足不同场景下的需求。
- 引入 DeepSeek Harness 开发者预览版,采用“一切皆插件”架构,实现模型与执行环境的解耦,增强执行系统的灵活性与可扩展性。
-
API 价格与成本分析
- 自 2026 年 8 月 17 日起,DeepSeek V4 Pro 采用峰谷定价策略,空闲时段价格为高峰时段的一半。
- 在“100 万未命中输入+20 万输出”的长程任务场景下,V4 Pro 空闲和高峰成本分别为 7.2 元和 14.4 元,相较于 Kimi K3、Claude Opus 和 GLM-5.2 具有明显成本优势。
- 价格调整反映了模型定位从“低价”转向“灵活调度”,适合夜间批量任务和复杂长程任务。
-
Harness 的开放架构
- 提供 Standard、PTC、Minimal 和 Creator 四种模式,支持不同执行环境和工具权限配置。
- 采用追加式会话日志,支持轨迹查看、恢复、分叉和回放,提升模型执行的可追溯性和审计能力。
- 仍处于开发者预览阶段,存在兼容性风险,需注意插件签名、最小权限、版本锁定和审计策略。
-
金融投研任务实测结果
- 估值任务:Kimi K3 表现最佳,采用“分产品销量×单价”的方式,颗粒度最细;DeepSeek V4 Pro 次之,但存在关键公式错位问题;GLM-5.2 最差,公式错误导致无法复算。
- 回测任务:DeepSeek V4 Pro 表现最优,考虑了交易成本和停牌处理,但持有期口径仍需优化;Kimi K3 次之,未处理涨跌停约束,回测结果可能高估收益;GLM-5.2 最差,未扣成本,逻辑闭环不足。
- 行业研究任务:DeepSeek V4 Pro 表现最好,投资框架可复算,数据来源清晰;Kimi K3 次之,但 Wiki 沉淀不足;GLM-5.2 最差,缺乏评分权重和计算方法,结论无法还原。
关键信息汇总
1. 模型规格与性能
| 模型 | 总参数 | 单 Token 激活参数 | 上下文长度 | 最大输出长度 | 思考强度 | 峰谷定价 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | 1.6T | 49B | 1M Token | 384K Token | low/high/max | 是 |
| Kimi K3 | - | - | 1M Token | - | - | 是 |
| GLM-5.2 | - | - | 1M Token | - | - |
2. API 价格对比(单位:元/百万 Token)
| 模型 | 空闲时段 | 高峰时段 |
|---|---|---|
| DeepSeek V4 Pro | 7.2 | 14.4 |
| Kimi K3 | 42.0 | 42.0 |
| GLM-5.2 | 13.6 | 13.6 |
| Claude Opus 4.8 | 70.0 | 70.0 |
| Claude Fable 5 | 140.0 | 140.0 |
3. 金融投研任务表现排名
| 任务类型 | 模型 | 排名 | 优势与不足 |
|---|---|---|---|
| 估值任务 | DeepSeek V4 Pro | 2 | 公式错位,修改假设后无法可靠重算 |
| Kimi K3 | 1 | 逻辑自洽,但公式错误影响复核 | |
| GLM-5.2 | 3 | 公式异常,结论无法还原 | |
| 回测任务 | DeepSeek V4 Pro | 1 | 成本与交易约束处理较好,但持有期口径不一致 |
| Kimi K3 | 2 | 交付完整,但未处理交易约束 | |
| GLM-5.2 | 3 | 未扣成本,逻辑闭环不足 | |
| 行业研究任务 | DeepSeek V4 Pro | 1 | 投资框架可复算,来源清晰 |
| Kimi K3 | 2 | 投资框架完整,但来源沉淀不足 | |
| GLM-5.2 | 3 | 知识库覆盖面广,但评分权重与计算方法缺失 |
总结
DeepSeek V4 Pro 在模型性能、API 价格和执行系统方面实现了全面升级,特别是在 Agent 能力和 Harness 架构上具有显著优势。虽然其在部分金融投研任务中表现优异,但在公式准确性、任务复算性和交易约束处理上仍存在改进空间。与 Kimi K3 相比,V4 Pro 在成本和执行系统上更具竞争力;与 GLM-5.2 相比,其在任务结构和逻辑完整性上更优。总体而言,DeepSeek V4 Pro 的竞争力已从单一模型能力转向模型与执行系统的协同,为金融机构提供了更具生产力的工具选择。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载