人工智能大模型体验报告2.0-新华社研究院中国企业发展研究中心_27页_1mb
报告摘要
中国AI大模型体验测评总结
2023年8月,新华社国家高端智库分中心发布《人工智能大模型体验报告20》。本次测评在题目设计、对标人类、打分权重和专家团队四大维度全面升级,共涵盖500道题目,引入高等教育人群作为Benchmark,细化二级分类权重,并由北京大学文化与传播研究所及行业专家组成测评团队,采用背靠背评分方式提升结果权威性。
测评结果与厂商表现
-
综合排名
人类在智商能力上明显领先,而大模型在工具提效方面表现突出。- 讯飞星火:工作提效和智商能力优势显著,多轮对话和跨模态能力表现优异。
- 文心一言(百度):基础能力综合指数最高(1014分),语言理解和多模态生成能力突出。
- 商量(商汤):情商测试得分最高(346分),能灵活处理一语双关和人际关系问题。
- ChatGLM(智谱AI):智商能力与星火并列第一(147分),展现较强逻辑推理与专业能力。
-
分模块测评
- 基础能力:重点考察语言生成、AI向善、跨模态转换和多轮对话。百度文心一言、商汤商量、智谱AI-ChatGLM表现优秀,360智脑、昆仑万维天工等尚佳。
- 智商测试:分常识知识(20%)、逻辑能力(50%)和专业知识(30%)。讯飞星火和ChatGLM并列第一,文心一言和天工表现良好,商汤商量、360智脑等需进一步优化。
- 情商测试:侧重日常尴尬应对、一语双关理解及人际关系管理。商汤商量、百度文心一言、澜舟科技-MChat及ChatGLM表现优良,360智脑、星火等尚佳。
- 工具提效:评估模型在生产工具(代码生成、数据分析)和创新生成(内容优化、流程改进)上的实用性。讯飞星火、文心一言等在工具和创新方面表现突出。
大模型发展现状与挑战
- 行业热度持续:2023年上半年,中国大模型相关融资事件超20起,北京、上海、杭州为主要聚集地,显示产业集中度较高。
- 科研与应用并进:学术界与企业合作构建体系化能力,大模型已渗透教育、金融、医疗、游戏等领域,超半数模型开源,推动商业化落地。
- 核心差距:尽管大模型在效率和基础能力上进步显著,但在情商(情绪感知与人际交往)、创造力等复杂领域仍落后于人类,需加强感知智能和多模态融合。
应用发展建议
- 降本增效:优化算法、分布式训练和模型压缩,降低计算资源需求。
- 提升易用性:改进用户界面设计,提供自动化工具和培训支持,形成数据-技术-用户的正向闭环。
- 保障安全:加强数据加密、访问控制及模型鲁棒性,避免误用或漏洞风险。
- 增强可解释性:通过行为分析和风险预警机制,推动AI技术在伦理和监管框架下的合规应用。
未来趋势
- 算力与基础设施:持续建设数据中心,提升算力集中化和高效化供给。
- 多领域融合:打通跨模态数据壁垒,构建一体化解决方案,推动技术与行业场景深度结合。
- 在线学习能力:强化模型增量学习与自适应能力,支持动态环境下的持续优化。
- 实体经济落地:探索大模型在工业、金融等领域的精准化应用场景,形成差异化竞争。
结论与展望
当前中国大模型已初步实现商业化,但需在安全、可靠性及人文交互能力上深化研发。政策层面,《生成式人工智能服务管理暂行办法》明确了发展与安全并重的方向。未来,头部厂商应聚焦自研大模型创新,行业企业则需通过垂类深耕形成特色解决方案。同时,开放平台合作与技术共享将成为加速落地的关键,助力中国AI产业实现跨越式发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载