TE智库-中国通用大模型内容生成及安全性能力评测-2023.6-25页_1mb
报告摘要
中国通用大模型内容生成及安全性能力评测报告总结
1. 报告概述
本报告由TE智库撰写,评估了中国本土通用大模型(如文心一言、通义千问、ChatGLM等)在内容生成及安全性方面的能力。评测基于标准化方法,包括基础服务能力、交互响应能力、理解创作能力、深度推理能力、专业领域能力和安全体系能力等维度。
2. 主要发现
- 综合能力:中国本土大模型综合能力已与ChatGPT 3.5相当,尤其在特定领域表现领先。文心一言和ChatGLM在安全体系能力上显著优于GPT 3.5,而国产模型整体能力呈梯队分化。
- 安全体系能力:中国模型在处理违法乱纪、隐私保护等问题时表现更优,能基于社会主义价值观提供正确指引;GPT 3.5在某些领域仍有差距。
- 其他能力维度:基础服务能力、交互响应能力和理解创作能力表现不俗,但深度推理和专业领域能力存在优化空间,如高幻觉率、信息陈旧及缺乏归纳等问题。
- 发展趋势:中国已有79个大模型,开发速度快,但需持续创新和遵守法规以加强竞争力。
3. 评测方法
- 标准:涵盖6大维度、27个指标,测试内容包括多领域任务。
- 过程:统一评测环境,通过专家反馈和试运营完善标准,注重法律风险和用户利益保护。
4. 建议
- 提升模型质量,优化深度推理和专业领域知识。
- 加强监管和安全体系建设,确保合规发展。
- 促进可持续路径,支持创新和合作,提高用户获得感。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载