中国工业互联网研究院:2023人工智能大模型在工业领域知识问答稳定性评测报告_31页_4mb
报告摘要
人工智能大模型在工业领域知识问答:稳定性评测总结
核心内容
本报告由中国工业互联网研究院联合香港科技大学和新华指数发布,旨在评估人工智能大模型在工业领域知识问答中的稳定性。报告从数据、文法、精简表达和扩充表达四大类八个子维度出发,对国内外代表性大模型进行系统评测,分析其在不同行业中的表现,并提出优化建议。
主要观点
- 稳定性定义:大模型在保持回答准确性的同时,应对参数扰动、数据形式、文法逻辑等变化仍能维持性能特性的能力。
- 评测体系:围绕数据、文法、精简表达、扩充表达四大类八个子维度展开评估。
- 评测方法:通过原问题与变体问题的对比测试,采用单选题和判断题形式,得分标准为与原问题答案一致得1分,否则得0分。
- 评分标准:稳定性能力指数 = 抗扰动能力指数(各维度得分 / 理论最高得分) × 100。
关键信息
一、数据稳定能力
- 整体表现:国内外头部大模型在数据稳定能力上接近90分,表现良好;GPT-4/3.5仍保持领先。
- 国内尾部模型:数据能力低于50分,需通过引入训练语料、知识库、工具函数集等方式进行强化。
- 应用建议:工业企业应使用数据形式稳定性高的模型,并对数据单位进行多重描述以防止理解偏差。
二、文法稳定能力
- 整体表现:GPT-4/3.5在文法稳定能力上表现突出,得分在85分以上;国内大模型整体水平需提升。
- 国内模型特点:在同/近义词稳定性上表现较好,但在逻辑变化和顺序变化上仍有较大提升空间。
- 应用建议:对于逻辑密集型任务,建议谨慎使用大模型,必要时进行人工校验。
三、精简表达稳定能力
- 整体表现:国内外头部大模型得分在90分左右,表现较强;GPT-4/3.5仍领先。
- 国内尾部模型:得分低于60分,需加强上下文处理能力和知识提取能力。
- 应用建议:在安全操作要求高的场景中,建议使用精简表达稳定性高的模型,并进行提示词优化和人工校验。
四、扩充表达稳定能力
- 整体表现:国内外头部大模型得分在80分以上,表现良好;GPT-4/3.5仍领先。
- 国内尾部模型:得分低于50分,需扩大上下文窗口并强化对齐能力。
- 应用建议:企业应通过精确指令和背景信息提升模型回答的稳定性。
行业维度评测
- 行业表现:国外头部大模型在电子设备行业稳定性表现突出;国内大模型在八个行业中的稳定性差距较小,但波动性较大。
- 国内提升空间:整体水平较国外头部模型有较大提升空间,需在各行业针对性优化。
评测结果与建议
评测结果
- 头部模型:GPT-4/3.5、通义千问、文心一言、星火、ChatGLM2、Minimax、天工、从容等模型在不同维度和行业中表现优异。
- 行业TOP5:各行业中,头部模型表现突出,尾部模型需进一步优化。
建议
- 数据稳定:国内尾部模型需引入训练语料、知识库、工具函数集等进行数据强化。
- 文法稳定:需提升逻辑变化和顺序变化的稳定性,强化语言理解能力。
- 精简表达:加强上下文处理能力和知识提取能力,尤其在安全操作场景中需谨慎使用。
- 扩充表达:扩大上下文窗口,强化对齐能力,提升信息提取稳定性。
评测模型列表
| 大模型名称 | 公司名称 | 版本信息 | Web链接 |
|---|---|---|---|
| GPT-4 | OpenAI | gpt-4-0613 | https://chat.openai.com |
| GPT-3.5 | OpenAI | gpt-3.5-turbo-0301 | https://chat.openai.com |
| 通义千问 | 阿里巴巴 | v1.0.5 | https://qianwen.aliyun.com |
| 文心一言 | 百度 | v2.2.2 | https://yiyan.baidu.com |
| 星火 | 科大讯飞 | v2.0 | https://xinghuo.xfyun.cn |
| ChatGLM2 | 智谱华章 | 6b | https://open/bigmodel.cn |
| Minimax | Minimax | V5.5 | https://api.minimax chat |
| 天工* | 昆仑万维 | v3.5.20230705.a | https://tiangong.kunlun.com |
| 从容* | 云从科技 | v20230518 | https://maas.cloudwalk.com |
| 360智脑 | 360 | V4.0 | https://chat.360.cn |
附录信息
- 变体测试集:从原始测试集中抽取客观题生成8类变体题目,构建变体测试集。
- 评测方式:部分模型采用Web端测试,其余为API调用测试。
- 后续计划:中国工业互联网研究院将联合港科大、新华指数发布“中国AI大模型工业应用指数”,推动人工智能与实体经济融合创新。
联系方式
- 联系人:叶老师 13661350566,吴老师 15210188099
- 地址:北京市朝阳区酒仙桥北路甲10号403号楼
- 电话:010-87901276
- 网址:www.china-aii.com
评测结论
- 总体结论:国外头部大模型在稳定性方面表现优异,国内大模型在数据、精简、扩充表达方面差距较小,但在文法稳定方面仍有较大提升空间。
- 应用建议:建议企业根据具体应用场景选择合适的大模型,并进行必要的校验和优化,以确保应用的安全性和可靠性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载