关于人工智能大模型的几点思考_69页_6mb
报告摘要
关于人工智能大模型的几点思考总结
核心内容概述
清华大学郑纬民教授在2025年4月11日的报告中,围绕人工智能大模型的发展趋势、生命周期管理、国产智算系统建设、企业应用路径以及相关技术成果进行了深入探讨。
主要观点与关键信息
2025年AI大模型的两个特点
- 多模态发展:从单模态向多模态演进,支持文本、音频、图像、视频等多种数据形式。
- 性能与规模提升:大模型在训练和推理性能上持续突破,如LLaMA-70B和MoE-567B等模型的广泛应用。
人工智能大模型生命周期的五个环节
- 数据获取:收集海量多模态数据,面临小文件存储的挑战。
- 数据预处理:占训练时间的30%-65%,对文件系统提出高延迟、高随机读取需求。
- 模型训练:需要海量算力,如GPT4训练使用1万块A100 GPU耗时11个月。
- 模型微调:需可控算力,针对特定领域进行优化。
- 模型推理:对实时性要求高,需稳定可靠的算力支持。
海量小文件存储挑战与解决方案
- 挑战:现有文件系统难以同时满足扩展性和低延迟需求。
- 集中式架构(如HDFS、Lustre):延迟低,但扩展性差。
- 分布式架构(如CephFS):扩展性强,但延迟高。
- 解决方案:提出“解耦合的目录树存储”架构。
- 低延迟:目录元数据集中在一台服务器中,避免跨服务器访问。
- 可扩展性:文件元数据分布于多台服务器,支持横向扩展。
- 实验结果:SuperFS文件系统相较CephFS、Lustre等系统,延迟降低51-59倍。
国产智算系统与基础软件
- 国产智算系统:国家推动智算中心建设,如上海、北京、江苏等地均提出国产算力占比目标。
- 核心基础软件:构建国产智算系统需要10个核心软件支持,包括:
- 并行系统、通信库、编程框架(如PyTorch、飞浆PaddlePaddle)
- 编译器(如CUDA、ROCM、oneAPI)
- 算子库、内存管理、调度系统、存储系统等。
- “八卦炉”系统:清华大学自主研发,支撑国产AI算力系统,包括:
- PowerFusion:面向国产AI芯片的智能编译器
- FastMoE:支持MoE模型训练的并行加速系统
- IntelliGen:高性能图算融合编译器
- FastDecode:高吞吐推理系统,支持KV-Cache分离存储
- FastTensor:面向不规则程序的编程语言
企业如何利用AI大模型
- 关键步骤:
- 识别企业核心问题,解决这些问题将带来根本性变化。
- 确保有足够的高质量数据支持模型训练。
- 在数据处理和模型优化上,若人工处理能力不足,需引入AI技术。
- 应用路径:
- 选择一个基础大模型。
- 对其进行微调,适配企业需求。
- 构建企业专用大模型,实现智能化升级。
技术应用案例
诸葛弩:以数据为中心的大数据处理引擎
- 设计目标:降低数据预处理延迟,提升效率。
- 优势:兼容PySpark接口,采用编译优化技术,实现数据本地化处理。
- 应用效果:在144GB数据规模下,加速比达4.2倍。
FastMoE:混合专家模型训练系统
- 挑战:传统并行方式难以应对显存不足、通信量大、负载不均等问题。
- 解决方案:采用新的并行策略,提升性能。
- 效果:在摩尔线程MCCX-D800 8卡机上取得1.32倍加速比。
FastDecode:高吞吐推理系统
- 挑战:大模型推理对显存需求大,KV-Cache占用大量资源。
- 解决方案:使用CPU和主存处理KV-Cache,实现存算分离。
- 效果:
- Llama-13b模型,清程Pro相较云燧S60+vLLM提升1.7倍吞吐。
- 清程Max相较原有方案提升7.6倍吞吐。
Mooncake:以KVCache为中心的推理架构
- 设计理念:以存换算,提升推理吞吐。
- 核心技术:
- 超大规模分离式内存池用于KVCache缓存和调度。
- 面向过载场景的调度策略,保障用户体验。
- 效果:在模拟实验中,相较vLLM提升75%的请求处理能力。
AI产业化趋势
- 中国优势:国家政策支持、企业积极性高,AI产业化进程加快。
- DeepSeek:代表国产AI大模型的突破,具有成本优势、模型效果好和开源特性。
- 未来方向:重视工程基础设施、算法优化和软件生态建设,以缩小与国际先进水平的差距。
国内AI会议与活动
- 北京:
- 全球软件开发大会(4月)
- 全球人工智能开发与应用大会(6月、12月)
- 上海:
- 全球软件开发大会(10月)
- 全球人工智能开发与应用大会(5月)
- 深圳:
- 全球人工智能开发与应用大会(8月)
这些会议聚焦AI大模型、智能硬件、多模态应用、AI Agent等前沿方向。
总结
- AI大模型正朝着多模态、高性能、大规模方向发展。
- 存储与算力是大模型训练和推理的核心瓶颈,需针对性优化。
- 国产智算系统建设是未来AI发展的关键,需突破软件生态限制。
- 企业应用应结合自身需求,通过选择基础模型、数据预处理和微调实现智能化升级。
- 技术成果如SuperFS、诸葛弩、八卦炉、Mooncake等,展示了中国在AI基础设施和应用层面的快速进步。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载