中国移动“弈衡”大模型评测体系研究及技术发展趋势洞察-19页_6mb
报告摘要
中国移动“弈衡”大模型评测总结
评测概述
“弈衡”评测作为中国移动核心技术能力的度量衡和磨刀石,旨在通过全面、客观的第三方技术能力评测,支持公司重点产品和能力的发展。秉持“一体五环”框架,聚焦全面积累,包括文本、视觉、语音、数据分析等多领域。
覆盖领域与技术能力
评测涵盖广泛领域:
- 文本类:文本分类、命名实体识别、情感倾向分析等。
- 视觉类:人脸识别、图像检测、视频分析等。
- 语音类:声纹识别、语音合成、情感识别等。
- 应用与行业:涵盖智慧运维、智能客服、AR/VR、医疗、金融、工业质检等,涉及AI模型工业应用和创新场景。
评测维度与方法
- 评测要素包括功能性、准确性、可靠性、安全性、交互性、社会偏见管理等。
- 设指标涵盖246项基准测试,数据和工具来自共性技术栈,支持多模态应用任务。
- 评估方式包括代码生成、基础任务和应用任务,强调多模态能力和鲁棒性。
国内外模型比较
- 竞争格局显示国外模型(如GPT-4、Claude、Gemini)领先,国内模型(如星火、文心、通义、闲鱼等)快速追赶,国内平均增至80%。
- 中国模组性能占优,分布北京、上海等地,模型数量和综合性能别提升。
发展展望与生态构建
未来将培育专业评测机构,强化自主创新模型研发,促进外部优质模型的合作选择。通过构建合作联盟、开放评测平台,与产业界携手推进大模型生态可持续发展
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载