2023-03-18-OpenAI-GPT-4_技术报告(中文版)_151页_14mb
报告摘要
GPT-4技术报告总结
核心内容
GPT-4是OpenAI开发的一款大规模多模态模型,能够处理图像和文本输入,并生成文本输出。尽管在某些现实场景中不如人类,但其在多个专业和学术基准测试中表现接近人类水平。
主要观点
- GPT-4在多项模拟考试中表现出色,如统一律师考试、LSAT、SAT等,其得分通常优于GPT-3.5。
- 在NLP基准测试中,GPT-4优于现有模型和大多数最先进的系统。
- GPT-4在多种语言(包括低资源语言)中表现良好,显示出强大的多语言能力。
- 该模型的性能可以通过可预测的扩展方法进行准确预测,这基于对较小模型的训练数据和计算量的分析。
- GPT-4在视觉理解方面也表现出色,能够处理图像输入并生成合理的文本输出。
- GPT-4在处理事实性和推理任务时,虽然表现出色,但仍存在一定的局限性,如幻觉和推理错误。
关键信息
模型性能
| 考试 | GPT-4 | GPT-4 (无视力) | GPT-3.5 |
|---|---|---|---|
| 统一律师考试 | 298/400 (约90%) | 298/400 (约90%) | 213/400 (第10位) |
| LSAT | 163 (第88位) | 161 (第83位) | 第149位 (第40位) |
| SAT循证读写 | 710/800 (约93%) | 710/800 (约93%) | 670/800 (第87位) |
| SAT数学 | 700/800 (第89位) | 690/800 (第89位) | 590/800 (第70位) |
| GRE定量 | 163/170 (第80位) | 157/170 (~62%) | 147/170 (第25位) |
| GRE口语 | 169/170 (第99位) | 165/170 (第96位) | 154/170 (~63%) |
| GRE写作 | 4/6 (第54位) | 4/6 (第54位) | 4/6 (第54位) |
| USABO半决赛2020 | 87/150 (第99-100位) | 87/150 (第99-100位) | 43/150 (31-33位) |
| 2022年USNCO地方科考试 | 36/60 | 38/60 | 24/60 |
| 医学知识自我评估计划 | 75% | 75% | 53% |
| Codeforces评级 | 392 (低于第5名) | 392 (低于第5名) | 260 (低于第5名) |
| AP艺术史 | 5 (第86-100位) | 5 (第86-100位) | 5 (第86-100位) |
| AP生物学 | 5 (第85-100位) | 5 (第85-100位) | 4 (第62-85位) |
| 微积分 | 第4 (第43-59位) | 第4 (第43-59位) | 1 (第0-7位) |
| AP化学 | 4 (第71-88位) | 4 (第71-88位) | 2 (第22-46位) |
| AP英语语言与写作 | 2 (第14-44位) | 2 (第14-44位) | 2 (第14-44位) |
| AP英语文学与写作 | 2 (第8-22位) | 2 (第8-22位) | 2 (第8-22位) |
| AP环境科学 | 5 (第91-100位) | 5 (第91-100位) | 5 (第91-100位) |
| AP宏观经济学 | 5 (第84-100位) | 5 (第84-100位) | 第2 (第33-48位) |
| 微观经济学 | 第5 (第82-100位) | 4 (第60-82位) | 4 (第60-82位) |
| AP物理2 | 4 (第66-84位) | 4 (第66-84位) | 3 (第30-66位) |
| AP心理学 | 第5 (第83-100位) | 第5 (第83-100位) | 第5 (第83-100位) |
| AP统计 | 5 (第85-100位) | 5 (第85-100位) | 3 (第40-63位) |
| 美联社美国政府 | 5 (第88-100位) | 5 (第88-100位) | 4 (第77-88位) |
| 美联社美国历史 | 5 (第89-100位) | 4 (第74-89位) | 4 (第74-89位) |
| AP世界历史 | 4 (第65-87位) | 4 (第65-87位) | 4 (第65-87位) |
| AMC 10 | 30/150 (第6-12位) | 36/150 (第10-19位) | 36/150 (第10-19位) |
| AMC 12 | 60/150 (第45-66位) | 48/150 (第19-40位) | 30/150 (第4-8位) |
| 品酒师入门(理论知识) | 92% | 92% | 80% |
| 注册侍酒师(理论知识) | 86% | 86% | 58% |
| 高级侍酒师(理论知识) | 77% | 77% | 46% |
| Leetcode(简易) | 31/41 | 31/41 | 12/41 |
| Leetcode(中等) | 21/80 | 21/80 | 8/80 |
| Leetcode(硬) | 3/45 | 3/45 | 0/45 |
性能预测
- GPT-4的损失和能力可以通过标度律进行预测,使用较小模型的性能数据。
- 在HumanEval数据集上,GPT-4的通过率可以通过计算量进行预测,尽管在某些情况下预测结果存在偏差。
视觉输入示例
- GPT-4能够理解并分析图像,例如描述一张带有三个面板的“闪电电缆”适配器包装的幽默点。
- 图像和文本结合的提示下,GPT-4能够生成符合预期的文本输出。
局限性
- GPT-4仍存在一定的不可靠性,如生成幻觉和推理错误。
- 它对训练后数据的了解有限,无法掌握2021年9月之后的事件。
- 在处理某些复杂问题时,可能引入安全漏洞。
安全和风险
- GPT-4在对抗性测试中表现出较高的安全性,但仍存在一定的风险。
- 通过领域专家的测试,我们能够识别并减轻模型在高风险领域的行为。
- 模型在某些情况下仍可能产生不安全或不准确的输出,例如生成有害内容或拒绝无害请求。
- 我们采取了多种措施,如模型辅助安全管道、对抗性测试和RLHF微调,以提高模型的安全性和一致性。
风险缓解措施
- 通过对抗性测试和红队,我们识别并减轻了模型的风险。
- 使用模型辅助的安全管道和基于规则的奖励模型,以引导模型产生更符合预期的行为。
- 通过RLHF微调,我们显著提高了模型的安全性和一致性。
公共安全指标
- 在RealToxicityPrompts数据集上,GPT-4的毒性生成率显著低于GPT-3.5。
- 在TruthfulQA基准上,GPT-4的准确率优于GPT-3.5。
可靠性与扩展
- GPT-4的扩展方法是可预测的,这使我们能够可靠地预测其性能。
- 通过减少计算量,我们能够准确预测GPT-4的性能表现。
部署与基础设施
- GPT-4的部署涉及多个团队的合作,包括产品管理、安全、基础设施和训练等。
- 我们计划开源OpenAI Evals,以创建和运行评估模型的基准。
模型优化与训练
- GPT-4基于Transformer模型,经过预训练和RLHF微调。
- 优化方法和基础设施的开发是该项目的核心组成部分,使得模型在广泛规模下表现可预测。
技术细节
- 本报告不包含模型的具体架构、训练计算、数据集构建等详细信息。
- 我们计划在未来向更多第三方提供技术细节,以促进透明度和科学价值。
附录
- 附录A:考试评估方法
- 附录B:RLHF对模型性能的影响
- 附录C:污染检查
- 附录D:基准测试污染
- 附录E:GSM-8K的训练数据
- 附录F:MMLU翻译和提示示例
- 附录G:使用图像和文本的标准测试技术
参考文献
- [1] 汤姆·布朗、本杰明·曼、尼克·赖德、梅勒妮·苏比亚、贾里德·D·卡普兰、普拉富拉·达里瓦尔、阿尔温德·尼拉坎坦、普拉纳夫·希亚姆、吉里什·萨斯特里、阿曼达·阿斯克尔等。语言模型是很少尝试的学习者。神经信息处理系统进展,33:1877-1901,2020。
- [2] 乔丹·霍夫曼、塞巴斯蒂安·博格奥德、亚瑟·门施、埃琳娜·布查茨卡娅、特雷弗·蔡、伊莱扎·卢瑟福、迭戈·德拉斯·卡萨斯、丽莎·安妮·亨德里克斯、约翰内斯·韦尔布尔、艾丹·克拉克等。训练计算最优的大型语言模型。arXiv预印本arXiv: 2203.15556, 2022。
- [3] Aakanksha Chowdhery、莎兰·纳朗、Jacob Devlin、Maarten Bosma、Gaurav Mishra、Adam Roberts、Paul Barham、Hyung Won Chung、Charles Sutton、Sebastian Gehrmann等。PaLM:用路径扩展语言建模。arXiv预印本arXiv: 2204.02311, 2022。
- [4] 杰克·W·雷伊、塞巴斯蒂安·博格奥德、特雷弗·蔡、凯蒂·米利肯、乔丹·霍夫曼、弗朗西斯·宋、约翰·阿斯兰尼德斯、莎拉·亨德森、罗曼·林、苏珊娜·杨等。扩展语言模型:训练 gopher的方法、分析和见解。arXiv预印本arXiv: 2112.11446, 2021。
- [5] 戴子航、杨志林、杨一鸣、海梅·卡波内尔、Quoc V.Le 和 Ruslan Salakhutdinov。Transformer model-XL:超越固定长度语境的专注语言模型。arXiv 预印本 arXiv: 1901.02860, 2019。
- [6] 刘、迈尔·奥特、纳曼·戈亚尔、杜、曼达尔·乔希、陈丹琪、奥马尔·利维、迈克·路易斯、卢克·泽特莱莫耶和韦塞林·斯托扬诺夫。Roberta:一种稳健优化的bert预训练方法。arXiv预印本arXiv: 1907.11692, 2019。
- [7] 雅各布·德夫林、张明伟、肯顿·李和克里斯蒂娜·图塔诺娃。BERT:语言理解深度双向转换器的预训练。arXiv预印本arXiv: 1810.04805, 2018。
- [8] 科林·拉菲尔、诺姆·沙泽尔、Adam Roberts、凯瑟琳·李、、迈克尔·马泰纳、、和彼得·J·刘。用统一的文本到文本Transformer model探索迁移学习的局限性。arXiv预印本 arXiv: 1910.10683, 2019。
- [9] 诺姆·沙泽尔和米切尔·斯特恩。具有次线性记忆成本的自适应学习率。arXiv预印本arXiv: 1804.04235, 2018。
- [10] 杰米·雷恩·基罗斯和杰佛瑞·E·辛顿。图层归一化。arXiv预印本arXiv: 1607.06450, 2016。
- [11] 杰森·魏、、戴尔·舒尔曼斯、马腾·博斯马、埃德·池、郭乐和丹尼·周。思维链提示引发大型语言模型中的推理。神经IPS,2022。
- [12] 黄家新、顾世祥、、吴月新、、于洪坤、韩家伟。大型语言模型可以自我完善。arXiv预印本arXiv: 2210.11610, 2022。
- [13] 小岛康誉武、史翔·沙恩·顾、马谢尔·里德、松尾裕太和岩泽佑介。大型语言模型是零镜头推理器。arXiv预印本arXiv: 2205.11916, 2022。
- [14] 贾里德·卡普兰、萨姆·麦坎德利什、汤姆·海尼根、汤姆·B·布朗、本杰明·切斯、雷文·蔡尔德、斯科特·格雷、亚历克·拉德福德、杰弗里·吴和达里奥·阿莫代。神经语言模型的标度律。arXiv预印本arXiv: 2001.08361, 2020。
- [15] 汤姆·海尼根、贾里德·卡普兰、莫尔·卡茨、陈马克、克里斯托弗·黑塞、雅各布·杰克森、希宇俊、汤姆·B·布朗、普拉富拉·达里瓦尔、斯科特·格雷等。自回归生成模型的标度律。arXiv预印本arXiv: 2010.14701, 2020。
- [16] Greg Yang、Edward J.Hu、Igor Babuschkin、Szymon Sidor、、David Farhi、Nick Ryder、Jakub Pachocki、、和高建峰。张量程序v:通过零镜头超参数转移调整大型神经网络。arXiv预印本arXiv: 2203.03466, 2022。
- [17] 诺姆·沙泽尔、阿扎利亚·米尔霍塞尼、克日什托夫·马齐亚尔兹、安迪·戴维斯、国乐、杰弗里·辛顿和杰夫·迪恩。异常庞大的神经网络:稀疏门控的专家混合层。arXiv预印本arXiv: 1701.06538, 2017。
- [18] 巴雷特·佐夫、伊尔万·贝洛等。未提供完整引用信息。
作者与致谢
- 本报告由OpenAI团队编写。
- 我们感谢所有贡献者,包括核心捐助者、部署团队、安全团队、法律团队等。
- 我们特别感谢微软的合作伙伴关系,包括Azure支持和安全团队的合作。
- 我们感谢所有参与对抗性测试和红队的专家,他们在模型评估和风险识别方面提供了重要帮助。
- 我们感谢所有参与模拟律师考试的合作者,他们在案例文本和斯坦福法典方面提供了支持。
总结
GPT-4是一个大型多模态模型,具有强大的自然语言处理和视觉理解能力。尽管在某些情况下表现接近人类水平,但仍存在一定的局限性和风险。我们采取了一系列措施,包括对抗性测试、模型辅助安全管道和RLHF微调,以提高模型的安全性和一致性。未来,我们将继续改进这些方法,并与外部研究人员合作,以评估和减轻GPT-4的潜在影响。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载