20241012-中国移动通信研究院-『弈衡』多模态大模型评测体系白皮书(2024年)_29页_1mb
报告摘要
多模态大模型评测体系“弈衡”白皮书总结
人工智能技术发展迅速,特别是Transformer模型推出后,多模态大模型在图像、文本、视频和音频处理等方面展现出强大能力,成为推动产业升级的重要引擎。尽管现有业界评测体系如MMBench、OCRBench、智源评测体系等从不同角度评估模型性能,但仍存在评测数据覆盖不足、评测标准不统一、方式不完善等问题。
为解决上述挑战,中国移动技术能力评测中心联合业界权威机构,提出“弈衡”多模态大模型评测体系,采用“2-4-6”层级架构,即2类评测场景、4项评测要素和6种评测维度,具体包括:
一、评测场景与指标体系
- 评测场景分为基础任务和应用任务两类,涵盖识别、理解、创作和推理四大任务,如实例识别、情绪识别、图像生成等。
- 评测要素包括评测方式(零样本、单样本、少样本、提示优化)、评测指标(客观指标如准确率、F1值、泛化能力;主观指标如美学评价)、评测数据(强调选题多样性与梯度)和评测工具(提供自动化评估平台)**。
二、六大评测维度
- 功能性:任务支持完备程度,如多模态输入输出支持。
- 准确性:模型输出与真实答案的吻合度,如图像质量分析的准确率。
- 可靠性:抗噪声干扰及答案一致性。
- 安全性:鉴别模型输出是否存在毒性、偏见等问题。
- 交互性:支持连续对话、响应及时性的评估。
- 应用性:实际场景中的部署及运维能力。
“弈衡”体系在用户视角下建立系统性评分机制,结合客观指标与人工评测,为不同任务定制评价方案,以提升大模型技术的健康发展和实际应用价值。
三、评估体系价值与未来展望
“弈衡”评测体系旨在提供统一、公平、可操作的评测标准,推动多模态大模型在各领域的深度整合与效果提升。未来,评测技术应更注重实际业务场景,持续优化评测内容与技术手段,并保持与模型演进而同步更新,支撑“人工智能+千行百业”的高质量落地。
综上所述,中国移动提出的“弈衡”评测体系兼具系统性和创新性,为行业内构建统一评估基准提供了重要基础,有望进一步促进多模态大模型的健康发展和广泛应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载