复旦大学2024如何提升大模型任务能力报告39页_4mb
报告摘要
-
大模型任务能力提升主要依赖于预训练和微调阶段。预训练需大量高质量文本数据(如图书、百科、网页等),使用数千亿单词规模,需1000+GPU月级别训练时间。SFT模型则通过标注用户指令及答案进行指令微调,训练资源需求为1-100GPU天级别。强化学习阶段需结合奖励函数和用户指令,训练时间同样为1-100GPU天级别。
-
预训练阶段知识储存机制显示,模型并非逐字记忆,而是通过问答方式提取信息。知识以(name,attribute,value)三元组形式表示,比特复杂度衡量知识存储效率,如1亿参数模型若存储22亿比特知识,其容量比例为22bit/参数。GPT2模型在充分训练后可保持2bit/参数的存储能力,但需稳定训练1000次样本以确保知识记忆。
-
预训练阶段结论:单一知识点需大量重复训练;高质量数据密度对模型能力提升至关重要;模型需足够训练才能达到2bit/参数的知识存储能力;若预训练未成功,微调无法弥补能力缺失。知识获取依赖原始数据,而非微调数据。
-
监督微调阶段存在四种训练方法:数学推理、编程、通用任务与指令微调数据量的关系;复合任务中可能产生性能冲突,关键因素包括数据分布与任务格式差异;DMT策略(差异化混合训练)能缓解冲突。实验显示,单个任务训练时大模型表现更优,混合任务在低资源场景提升能力,高资源场景则导致能力下降。
-
强化学习对生成任务效果提升具有决定性作用,但需注意其对世界知识的破坏性。RLHF(强化学习人类反馈)可减轻曝光偏置,提升代码生成效果(如StepCoder项目)。强化学习通过分解代码生成任务为子目标(CCCS)和细粒度优化(FGO)降低探索难度,最终在多任务中超越基线模型。
-
核心结论:标注数据量决定任务效果提升,单纯增加数据量无法提升模型性能;多任务间存在复杂关联,需深入研究其影响机制;强化学习对生成式任务有显著作用,但需平衡数据比例与任务类型。大模型通过预训练阶段形成基础能力,微调阶段通过数据优化实现特定任务对齐。
-
任务能力发展特点:多数任务在初始阶段需逐步叠加能力,但过度叠加可能削弱原有任务表现。大模型完成复杂任务(如CBQA)的能力主要源自预训练阶段的世界知识,而非微调数据。高质量数据(如维基百科)比低质量数据(如CommonCrawl)更有效促进能力提升。
-
挑战与反思:大模型可通过少量样本快速达到基础性能(70分),但实现高精度(90分)需极高质量标注数据。核心问题在于知识存储与提取机制的优化,以及不同任务间的协同训练策略。需关注统计机器学习方法在模型能力提升中的应用,而非过度依赖AGI或涌现等概念。
试读结束,高清完整版pdf/doc/ppt,请点下载