中国工业互联网研究院:人工智能大模型工业应用准确性测评报告_22页_4mb
报告摘要
人工智能大模型工业应用准确性测评2024年3月版总结
一、前言
本报告旨在测评人工智能大模型在工业领域的应用性能,涵盖知识问答、数据分析、工程建模、文档生成及代码理解五大场景。报告依托国家工业互联网大数据中心,结合工业调研,对国内外具有代表性的大模型进行全面评测,为工业智能化转型提供参考依据。
二、测评内容
- 场景构建:设立知识问答、数据分析、工程建模、文档生成和代码理解五大工业应用场景。
- 题库设计:
- 知识问答:覆盖石化化工、电力电子等行业,共144题;
- 工程建模:100道多步骤数学建模题;
- 文档生成:分为总结与观点分析等子类,共80题;
- 数据分析:分析图表数据,共50题;
- 代码理解:针对哈希算法等编程问题,共15题。
三、测评方法
- 评分机制:
- 采用问答题为主,基于GPT-4生成判分标准;
- 分步骤赋分,确保判分一致性;
- 归一化处理得分,计算场景总分与综合评分。
- 流程说明:收集大模型答案→自动根据标准答题赋分→归一化处理→输出结果。
四、测评结果
1. 综合排名
- 国际领先:GPT-4排名居首;
- 国内进步:文心一言、ChatGLM、星火3.5等已接近或超越GPT-3.5;
- 细分领域:
- 工业知识问答:国内模型已在建材、采矿等领域表现优越;
- 工程建模与代码理解:国际领先模型优势明显;
- 文档生成:国内模型在文档要点总结中表现卓越。
2. 能力对比
- 知识问答:ChatGLM、文心一言等国内模型在多个子领域已超过GPT-4;
- 工程建模与数据分析:国际领先模型在完整性与逻辑准确性方面仍有优势;
- 文档生成与代码理解:不同场景模型表现不一,需持续优化。
五、应用场景测评
1. 工业知识问答
- 覆盖研发设计、生产制造、售后服务等环节;
- 国内模型表现强劲,尤其在行业知识储备上领先。
2. 工程建模
- 主要应用于数学建模与生产计划优化;
- 国内外平均成绩较低,模型建模能力处于初级阶段。
3. 数据分析
- 评分高于建模题,说明大模型在数据提取与结论归纳方面已有一定能力;
- 国内模型表现尚可,但需进一步提升。
4. 文档生成
- 国内模型在文档结构总结方面表现良好;
- 观点分析仍处于及格水平,建议进一步收集高质量工业语料。
5. 代码理解
- 国际领先模型在代码纠错与逻辑理解上优势明显;
- 国内模型还需加强工业编程知识库建设。
六、总结
人工智能大模型在工业知识问答、文档生成等场景已具备较强能力;而在工程建模、代码理解方面尚有待提升。国内外大模型差距逐步缩小,未来需加强工业知识库建设、优化模型训练数据,推动大模型在工业场景的全面落地应用。
附录
- 涉及模型版本与评分规则;
- 各子类题目示例。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载