20240203-财通证券-计算机行业投资策略周报_国产大模型密集更新_全力追_GPT-4_12页_1mb
报告摘要
国产大模型密集更新,全力追赶GPT-4
核心观点
当前,AI大模型的发展正从“模型即应用”向“能力即落地”转变。模型的能力与应用的成功率高度相关,且AI应用主要解决的是效率提升问题,而非新场景的创造。因此,行业期待通过参数量和算力的提升,实现基座模型的再次“涌现”,以突破当前性能天花板。
评估大模型能力的方法包括:
- 对比GPT-4的功能完备性:关注模型是否具备如长上下文、Function Calling、System Prompt、多模态、Web搜索、RAG、Assistants API等能力。
- 基准测试分数:如MMLU、BIG-bench、HumanEval等,但这些测试更多衡量记忆而非智力。
- LMSYS对战榜:通过用户投票和Elo评级系统,反映模型在文本对话方面的实际表现。
国内大模型厂商密集更新
自今年1月以来,国内大模型厂商纷纷推出新一代基座模型,以追赶GPT-4。以下是主要厂商及其最新成果:
2.1 智谱AI:发布GLM-4
- GLM-4是新一代基座大模型,其API是国内首个集齐 $100k+$ 长上下文、Function Calling和System Prompt的商用API。
- 性能相比上一代提升 $60%$,支持128k上下文长度和更强的多模态能力。
- 在多个测试中,GLM-4性能接近GPT-4,尤其在中文任务中表现优异。
2.2 MiniMax:发布abab6
- abab6是国内首个千亿参数量以上的MoE大模型,训练效率高,性能显著提升。
- 在IFEval、MT-Bench和AlignBench等测试中,abab6优于前一代abab5.5,并在指令遵从、中文和英文能力上超越GPT-3.5,与Claude 2.1和Mistral-Medium相比也有优势。
2.3 百川智能:发布Baichuan3
- Baichuan3是超千亿参数的大语言模型,在多个英文和中文评测中表现接近甚至超越GPT-4。
- 在中文医疗任务中表现最佳,数据质量通过因果采样动态选择方案得到提升。
- 训练效率提升超过 $30%$,在数学、代码和逻辑推理等任务中表现突出。
2.4 科大讯飞:发布讯飞星火V3.5
- 星火V3.5在文本生成、语言理解、知识问答、逻辑推理、数学能力、代码能力、多模态能力等方面全面超越GPT-4Turbo。
- 开源了基于全国产算力平台“飞星一号”的星火开源-13B,涵盖基础模型和微调工具,便于学术和企业研究使用。
2.5 万兴科技:发布天幕大模型
- 天幕大模型专注于数字创意垂类创作,具备音视频生成式AI技术。
- 已迭代近百项音视频原子能力,如文生主题视频、AI歌手、视频AI配乐等。
- 提供一站式AI解决方案,涵盖图像、音频、视频生成与编辑能力,并开放API以促进产业联动。
2.6 面壁智能:发布MiniCPM
- MiniCPM是端侧大模型,参数规模为2B,在中文知识、代码、数学等测评中超越Mistral-7B。
- 在英文榜单中也能追平或超越Llama2-13B、Deepseek-7B等大模型。
- 支持CPU推理,压缩 $75%$ 时基本无损性能,且可在主流手机系统上运行。
投资建议
- C端标准化工具类产品:建议关注金山办公、万兴科技、美图公司、同花顺、科大讯飞、福昕软件、合合信息(IPO)等公司。
- AI硬件创新:关注边缘端硬件公司如传音控股、漫步者、石头科技、九号公司,以及与芯片厂商合作紧密的赋能型公司如中科创达。
- 教育垂直领域:可能成为大模型落地的先行领域,建议关注佳发教育、鸿合科技等。
- 算力相关企业:AI服务器及国产AI芯片厂商如海光信息、协创数据、神州数码、浪潮信息、中科曙光、高新发展、优刻得、紫光股份、寒武纪等值得关注。
风险提示
- 技术迭代不及预期:若AI技术进展缓慢,可能影响模型性能和行业整体发展。
- 商业化落地不及预期:AI应用的商业化路径尚不清晰,需持续观察。
- 政策支持不及预期:新行业的发展依赖政策扶持,存在不确定性。
- 全球宏观经济风险:经济波动可能影响AI相关企业的市场表现。
图表目录
- 图1:开源模型最高分平均分(左)、各项最高分及人类基准(右)
- 图2:LMSYS对战榜模型排名
- 图3:GLM-4性能逼近GPT-4
- 图4:abab6测评及对比结果
- 图5:Baichuan3测评及对比结果
- 图6:讯飞星火V3.5发布
- 图7:天幕大模型音视频原子能力现场展示
- 图8:MiniCPM在多项评测榜单超过Mistral-7B
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载