20260808-国金证券-大模型赋能投研系列之二十七_DeepSeek_V4_Flash金融投研能力测评以及本地部署方案分析_28页_3mb
报告摘要
金融工程组研究报告:DeepSeek V4 Flash 金融投研能力测评及本地部署方案分析
核心内容概述
本报告对 DeepSeek V4 Flash、Kimi K3 和 GLM-5.2 三款大模型在金融投研场景中的表现进行了横向测评,主要围绕估值建模、多因子回测和行业研究三类典型任务展开。测评结果显示,三款模型在金融研究任务中均具备一定能力,但存在显著差异。此外,报告还详细分析了 DeepSeek V4 Flash 的本地部署方案,包括模型参数规模、精度优化、部署配置及量化路径,为模型在金融研究场景中的落地提供参考。
主要观点与关键信息
一、DeepSeek V4 Flash 发布与特性
- 发布背景:2026年7月31日,DeepSeek 发布 V4 Flash 正式版 API,重点提升长上下文效率、推理成本及可部署性。
- 模型规格:总参数量 284B,激活参数 13B,支持 1M Token 上下文,最大输出 384K Token。
- 价格优势:输入价格 0.02 元/百万 Token,输出价格 2 元/百万 Token,约为 Kimi K3 的二十分之一,GLM-5.2 的八分之一。
- 推理模式:支持 low、high、max 三档思考强度,适合不同复杂度的投研任务。
二、本地部署方案分析
- 模型压缩:DeepSeek V4 Flash 相比 R1 模型参数规模显著下降,降低了存储与推理成本。
- 部署路径:
- 官方权重 + vLLM/SGLang:适合高性能服务化部署,需高显存配置(如 4×GB300、8×B200)。
- 社区 GGUF 量化包 + llama.cpp:可降低硬件门槛,适合中低端配置,如单机 2 张 RTX PRO 6000(192GB 显存)。
- 硬件需求:推荐使用 128GB 内存的设备运行 2-bit 或 3-bit 版本;256GB 及以上内存适合运行 Q4 或 Q8 版本。
- 部署优势:支持数据不出域、调用无限制、模型版本可锁定,适合金融机构的内部部署需求。
三、金融投研任务实测点评
1. 估值建模任务
- 任务要求:构建公司业务拆解、三张财务报表、DCF 和相对估值模型,输出投资分析报告。
- 模型表现:
- Kimi K3:结构完整,逻辑自洽,但未体现产品销量与单价的联动性,预测方法颗粒度最细,综合排名第一。
- DeepSeek V4 Flash:底稿质量最佳,具备公式联动、可复算性,但收入预测逻辑较粗略,仅使用增速驱动,未考虑量价变化,综合排名第二。
- GLM-5.2:工作簿结构完整,但核心公式异常,关键数据无法正常计算,报告逻辑存在冲突,综合排名第三。
2. 多因子回测任务
- 任务要求:基于沪深300 历史成分股构建多因子模型,输出净值、回撤、换手率、持仓明细及绩效指标。
- 模型表现:
- DeepSeek V4 Flash:唯一计入交易成本并剔除不可交易个股,底稿完整,可追溯性好,但交易时点处理存在偏差,综合排名第一。
- Kimi K3:完成主要回测模块,但未区分信号日与执行日,未处理涨跌停等不可交易状态,综合排名第二。
- GLM-5.2:未区分信号与执行日,未计入交易成本,部分图表生成存在问题,综合排名第三。
3. 行业研究任务
- 任务要求:构建行业深度报告、知识库、投资框架等,支持数据溯源和报告输出。
- 模型表现:
- DeepSeek V4 Flash:公司数据库覆盖最全,无断链,但知识库页面较少,内部引用缺失,综合排名第二。
- Kimi K3:报告和投资框架较完整,但 Wiki 内容沉淀不足,综合排名第一。
- GLM-5.2:公司覆盖较多,但投资框架逻辑不清,来源管理不完整,综合排名第三。
三类金融投研任务表现对比
| 项目 | DeepSeek V4 Flash | Kimi K3 | GLM-5.2 |
|---|---|---|---|
| 估值任务 | 底稿质量最佳,但预测方法较粗 | 报告逻辑自洽,但底稿联动性弱 | 报告内容丰富,但逻辑冲突严重 |
| 回测任务 | 仅计入交易成本,但信号与执行时点处理不一致 | 未区分信号日与执行日,未处理涨跌停 | 未区分信号日与执行日,未计入交易成本 |
| 行业研究 | 数据完整,但知识库引用不足 | 报告完整,但 Wiki 内容沉淀不足 | 报告较广,但框架逻辑不清,来源管理不完整 |
风险提示
- 模型输出存在随机性和准确性风险;
- 历史规律无法代表未来,策略可能因市场变化失效;
- 交易成本或其它条件变化可能导致策略收益下降或亏损;
- 部分应用存在安全与版权风险,用户需自行承担相关后果。
总结
- DeepSeek V4 Flash 在底稿质量和工程实现上表现突出,尤其适合需要可复算性与数据时效性的金融研究场景;
- Kimi K3 在预测逻辑和报告结构上更优,但部分模型细节(如公式联动)仍有提升空间;
- GLM-5.2 虽然覆盖较广,但在模型质量和逻辑一致性上存在明显缺陷,影响实际可用性;
- 本地部署方案 为金融机构提供了数据安全、成本可控和模型版本可锁定的选项,DeepSeek V4 Flash 通过量化与优化,显著降低了部署门槛;
- 模型在金融投研任务中的表现与实际应用需求仍需进一步验证,尤其在稳定性、数据处理精度和可执行性方面。
附:关键模型对比与任务表现排名
- 估值任务排名:Kimi K3(1)、DeepSeek V4 Flash(2)、GLM-5.2(3)
- 回测任务排名:DeepSeek V4 Flash(1)、Kimi K3(2)、GLM-5.2(3)
- 行业研究任务排名:Kimi K3(1)、DeepSeek V4 Flash(2)、GLM-5.2(3)
- 综合排名:Kimi K3(1)、DeepSeek V4 Flash(2)、GLM-5.2(3)
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载