2025年大语言模型能力来源与边界报告-复旦大学-2025_55页_12mb
报告摘要
大语言模型能力总结
-
引言:复旦大学在大语言模型基础理论方面有重大突破,包括语言核心区和维度依赖理论,发表了80+篇相关论文。
-
理论分析:语言核心区理论解释了模型核心参数敏感性;例如,修改仅130亿参数中的一个,会导致模型混乱;该理论指导大模型训练和优化过程。
-
大模型能力:当前大模型主要处于“记忆”层级,依赖预训练知识和语义分布;在推理、理解等高级能力上仍有限制,AGI尚未实现。实验证明,大模型在数学和语言任务中(如高考数学、USAMO)表现不佳,平均70%水平,但受限于统计模型特性。
-
能力来源:主要包括预训练阶段(知识记忆+语义学习)、有监督微调(SFT,少量数据激活能力)和强化学习(RL,用于生成任务)。实验显示,推理能力受限于编码行为而非涌现现象。
-
实验局限:大模型对输入微小变化敏感,τ翻译和数学问题在改写后输出错误;SFT数据需求低,但知识记忆水平影响性能。核心参数修改极大影响模型稳定性。
-
总结结论:大语言模型是统计机器学习工具,非拟人化;可快速达到70%水平,但实现90%成绩极难;应注重场景选择,避免神话化其能力。训练过程涉及token级和参数级调整,模型泛化工具调用需优化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载