网络安全技术生成式人工智能服务安全基本要求_31页_549kb
报告摘要
《网络安全技术 生成式人工智能服务 安全基本要求》(GB/T 45654—2025)总结
核心内容概述
《网络安全技术 生成式人工智能服务 安全基本要求》(GB/T 45654—2025)是由国家市场监督管理总局发布的国家标准,旨在规范生成式人工智能服务的安全要求,确保其在训练数据、模型安全、安全措施等方面符合国家网络安全标准。该标准适用于服务提供者在开展生成式人工智能服务活动时的参考,也为相关主管部门和第三方评估机构提供了依据。
主要观点
1. 训练数据安全要求
- 数据来源安全:服务提供者需对数据来源进行安全评估与核验,若违法不良信息占比超过5%,不得采集或使用该数据来源。
- 数据内容管理:需对训练数据进行过滤,去除违法不良信息。过滤方法包括人工抽检、关键词、分类模型等。
- 数据标注安全:需对标注人员进行安全培训与考核,确保其具备相关能力。标注内容需分为功能性标注与安全性标注,分别制定规则并进行审核。安全性标注数据应隔离存储。
2. 模型安全要求
- 模型训练安全:应建设并更新安全风险测试题库,用于模型优化和复测;同时应建立安全性标注数据集进行安全微调。
- 模型输出安全:确保生成内容合格率不低于90%,提高准确性、可靠性,并对明显违法或诱导性问题进行拒答。生成内容应具备标识,符合国家相关规定。
- 模型监测测评:需对模型输入内容进行持续监测,防范恶意攻击。建立常态化监测手段及应急管理措施,及时优化模型。
- 模型更新、升级安全:需制定安全管理策略,并在重要更新后进行安全评估。
- 模型环境安全:训练环境与推理环境应实现隔离,避免数据泄露与不当访问。
3. 安全措施要求
- 服务适用人群、场合、用途:应充分论证服务的适用性与安全性,针对关键信息基础设施、未成年人等特殊场景,设置相应的安全保护措施。
- 服务透明度:服务提供者应公开服务适用人群、场合、用途等信息,并在服务协议中说明模型、算法等使用情况。
- 使用者输入信息收集:需为使用者提供关闭输入信息用于训练的便捷方式,并显著告知其状态。
- 投诉举报机制:应建立有效的投诉举报途径与反馈方式,并设定处理规则与时限。
- 服务稳定与持续性:需建立数据、模型、框架、工具等的备份机制与恢复策略,确保业务连续性。
- 端侧模型服务:端侧模型应具备激活机制、安全模块、日志管理、关键词库更新及漏洞修复机制。
关键信息
附录 A:训练数据及生成内容的主要安全风险
- A.1 包含违反社会主义核心价值观的内容(如煽动颠覆国家政权、传播虚假有害信息等)。
- A.2 包含歧视性内容(如民族、性别、年龄、职业等歧视)。
- A.3 商业违法违规(如侵犯知识产权、泄露商业秘密等)。
- A.4 侵犯他人合法权益(如隐私权、肖像权、名誉权等)。
- A.5 无法满足特定服务类型的安全需求(如关键信息基础设施、医疗、金融等)。
附录 B:安全评估参考方法
- 关键词库:应全面覆盖31种安全风险,总规模不少于10000个。
- 生成内容测试题库:应完整覆盖服务支持的所有模态和语言,总规模不少于2000题。
- 拒答测试题库:应覆盖应拒答与非拒答情况,总规模不少于500题。
- 分类模型:用于识别训练数据与生成内容中的安全风险,覆盖全部31种安全风险。
- 安全评估方法:包括数据来源评估、数据内容过滤评估、数据标注安全评估、模型训练安全评估、模型输出安全评估、模型监测测评、模型更新安全评估、模型环境安全评估及安全措施评估。
结构与适用范围
- 适用范围:适用于生成式人工智能服务提供者及相关主管部门和第三方评估机构。
- 规范性引用文件:引用了GB/T 25069等标准文件。
- 术语与定义:定义了生成式人工智能服务、服务提供者、训练数据、数据标注等关键术语。
总结
本标准为生成式人工智能服务的安全性提供了全面的指导框架,涵盖了数据安全、模型安全、安全措施等多个维度。通过严格的评估方法和管理要求,确保服务在技术层面与法律层面均符合国家网络安全规范。同时,该标准强调对特殊人群(如未成年人)和特定应用场景(如关键信息基础设施)的安全保护,进一步提升生成式人工智能服务的安全性与合规性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载