大语言模型(LLM)简介_74页_1mb
报告摘要
大型语言模型(LLMs)是基于大量文本数据训练的深度学习模型,其核心任务是为单词序列分配概率并通过采样生成文本。LLMs的三种主要架构包括纯解码器(如GPT)、编码器(如BERT)和编码器-解码器(如Flan-T5)。纯解码器通过自回归方式逐字生成文本,编码器通过双向预测训练,编码器-解码器则用于序列到序列任务(如机器翻译)。预训练阶段通常采用自我监督学习,通过预测下一个单词(或掩码单词)优化模型,使用交叉熵损失函数衡量预测准确性。预训练数据多来自互联网,包括书籍、新闻和维基百科,但存在版权、隐私及数据质量争议。
模型训练中,采样技术影响输出质量。Top-k采样通过保留前k个高概率单词平衡多样性和准确性,温度采样则通过调整温度参数τ控制分布的随机性。τ越高,输出越随机;τ越低,输出越确定。KV缓存技术在推理时提升效率,通过存储先前计算的键值向量避免重复计算。参数高效微调(PEFT)通过冻结大部分参数仅更新低秩矩阵(如LoRA)降低训练成本。
LLMs的应用涵盖情感分析、问答生成、文本续写等任务,通过条件生成实现。评估依赖困惑度(Perplexity)指标,反映模型对测试数据的预测能力,数值越低表示模型越好。标度定律表明模型性能与参数量、数据量和计算资源呈幂律关系,但需注意训练成本。潜在危害包括幻觉(生成虚假信息)、版权侵犯、隐私泄露及毒性内容,需通过数据过滤、安全机制和伦理规范缓解。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载