大模型基准测试体系研究报告(2024年)-中国信通院_52页_1mb
报告摘要
中国信息通信研究院人工智能研究所2024年大模型基准测试体系研究报告总结如下:
大模型作为人工智能技术的核心,其能力评测体系的建设对产业发展具有重要意义。报告指出,当前大模型评测已进入关键阶段,主要服务于研发指导、产品选型、行业应用支撑和监管辅助四大方向。然而,评测体系仍面临测试范围不完善、安全评估不足、数据污染等问题,需持续优化。
数据显示,2023年大模型基准测试成果爆发式增长,累计发布325个数据集、方法和榜单。评测数据集以语言类任务为主,占总量超50%,多模态评估仅占13%。中美在数据集发布量上竞争激烈,但国际影响力仍存在差距。开源数据集占69%,但需警惕模型通过记忆数据集“刷榜”的问题。
现有评测体系呈现三大共性:侧重通用能力测试,依赖考试形式,测试数据多采用单选、多选和问答类型。但同时也存在差异,如评测数据数量差异明显(知识类题量超1万,代码类仅千余题)、评测环境不同(语言模型多采用静态测试,具身智能需动态仿真环境)、评测目标分化(针对不同训练阶段模型)以及评测方法不统一(zero-shot与few-shot混用)。
“方升”测试体系提出四维建设框架:构建测试指标(含通用/行业/安全能力)、优化测试方法(动态更新题库)、完善数据集(覆盖多领域任务)和开发测试工具(支持自动化执行)。其创新点包括:通过标签化管理实现数据精准画像,采用动态题库防止刷题行为,设置三种测试模式(全量/模块/抽样)适配不同场景需求,综合考虑模型参数量、训练技术和数据质量对评测结果的影响。
首轮测试覆盖30多家主流模型,显示参数量与评测成绩正相关,但Qwen-18B等低参数模型在特定场景下表现优于高参数模型。测试结果揭示,大模型在多语言处理、代码生成等任务中存在明显短板,需结合部署成本、推理效率等多维度进行综合评估。
未来重点发展方向包括:构建产业应用导向的评测体系,开发超自动化测试平台,探索AGI等先进模型的评测技术。报告建议通过数据共享、工具标准化和方法创新,推动形成覆盖行业场景的评测体系,开发具备实时数据处理能力的测试平台,并针对AGI的跨模态、多任务特性建立更科学的评估框架。需重点关注测试数据的纯净度、评测维度的全面性和评估结果的可解释性,以确保评测体系服务于技术健康发展和产业需求满足。
试读结束,高清完整版pdf/doc/ppt,请点下载