深度报告-20260801-东吴证券-汽车行业深度报告_AI系列深度10期_预训练与后训练如何塑造大模型_10页_575kb
报告摘要
汽车行业深度报告总结
核心内容
本报告聚焦于人工智能在汽车行业中的应用,尤其是预训练与后训练对大模型能力形成与产品化适配的影响。报告分析了数字 AI 与物理 AI 在训练框架上的异同,指出两者的训练路径虽有共性,但在数据、反馈信号和瓶颈方面存在显著差异。同时,报告强调了从预训练到后训练的转型趋势,以及推理时计算对 AI 技术发展的推动作用。
主要观点
1. 预训练与后训练的分工与互补
- 预训练:在海量、低成本、无标注的数据上进行自监督学习,形成通用能力底座,决定模型的知识广度与能力上限。
- 后训练:在预训练模型基础上,使用少量高质量、带有人类意图或反馈信号的数据进行适配,决定模型输出方式、指令遵循、偏好对齐及任务可用性。
- 关键分歧:当前业界主要围绕能力来源(预训练 vs 后训练)、训练流程(两阶段 vs 三阶段)以及规模化重心(训练 vs 推理)展开讨论。
2. 数字 AI 与物理 AI 的异同
- 框架同构:两者均采用大模型训练范式,但数据和反馈来源不同。
- 数据差异:
- 数字 AI 以文本为主,依赖预测下一个词、掩码还原等自监督目标。
- 物理 AI 则依赖驾驶视频、机器人轨迹、仿真环境和安全奖励等真实交互数据。
- 瓶颈差异:
- 数字 AI 面临高质量公共文本接近供给上限的风险。
- 物理 AI 的核心瓶颈在于真实交互数据的稀缺。
3. 后训练的重要性上升
- 后训练方法包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)、直接偏好优化(DPO)、宪法 AI、可验证奖励强化学习(RLVR)等。
- RLVR 是当前最有效的后训练方法之一,尤其适用于可验证任务(如数学、代码),通过自动判定奖励,显著提升推理能力。
- 效率红利:后训练相比预训练,具有更高的边际收益,且更易实现成本控制与能力优化。
关键信息
1. 预训练:通用能力底座的形成
- 自监督学习:以“预测下一个词”为核心,使模型具备语法、事实、常识和部分推理能力。
- 扩展律(Scaling Law):模型性能随参数量、数据量和算力呈幂律下降,三者需按比例扩大以实现性能提升。
- 数据约束:高质量公共文本预计在 2028 年左右接近耗尽,需转向合成数据、多模态数据及后训练。
2. 后训练:能力调用与推理增强
- SFT:通过人工示范,使模型具备指令遵循与格式输出能力。
- RLHF:通过人类偏好训练奖励模型,再优化策略模型,提升模型的可用性与安全性。
- DPO:简化流程,直接对齐偏好,训练更稳定、成本更低。
- RLVR:利用可验证奖励,激励模型生成更长、更有效的推理链,提升推理表现。
3. 推理时计算与中训练
- 中训练(mid-training):作为预训练与后训练之间的过渡阶段,用于增强复杂能力,为后训练做准备。
- 推理时计算:在推理阶段引入额外算力,提升模型准确率,已成为提升推理能力的重要手段。
- 思维链(CoT):是连接预训练、后训练与推理的关键机制,可通过提示或强化学习触发。
4. 产业与投资视角
- 算力重心迁移:随着模型成熟,训练成本逐渐被推理成本所取代,推理成为新的成本中心。
- 规模化重心:从预训练转向后训练与推理效率,成为当前 AI 技术发展的新趋势。
- 中国厂商布局:聚焦后训练算法与推理效率优化,提升性价比与市场竞争力。
重点方向
- 数字 AI:以文本与多模态数据为主,强调通用能力的形成。
- 物理 AI:以真实交互数据为核心,代表场景包括自动驾驶与机器人。
- 自动驾驶:从端到端向 VLA(视觉语言代理)演进,强化学习成为后训练关键。
- 机器人:复用视觉语言骨干,通过真实与仿真数据进行后训练,动作表示方式仍是关键分歧点。
风险提示
- 技术迭代不及预期:数字 AI 与物理 AI 技术进展低于预期。
- 大模型厂商 ARR 增速放缓:客户增长、续费率或客单价不及预期。
- 云服务商资本开支不及预期:自由现金流承压,AI 算力需求与回报低于预期。
- 智能驾驶及机器人商业化落地不及预期:产品可靠性、成本下降或用户需求不足。
结论
预训练与后训练共同构成了大模型能力形成与产品化适配的核心链条。当前,随着数据供给接近上限,后训练与推理效率正成为 AI 技术发展与商业化落地的关键方向。物理 AI 作为 AI 在真实世界中的延伸,尤其在自动驾驶和机器人领域,其发展将依赖真实交互数据的获取与优化。中国厂商在后训练与推理效率上的布局,有望在这一趋势中占据优势。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载