20241206-Center_for_Security_and_Emerging_Technology-中华人民共和国国家标准_网络安全技术-生成的基本安全要求人工智能服务(反馈草案)_19页_584kb
报告摘要
这份征求意见的标准是中国国家标准,旨在为生成式人工智能服务设定网络安全和基本安全要求。核心目标是通过规范整个服务生命周期中的安全要求,减少和预防涉及AI服务的安全风险。主要关注点和要求包括:
一、总则与应用范围
- 标准规定了生成式AI服务的基本安全要求,内容涵盖培训数据安全、模型安全和安全措施,并提供安全评估方法。
- 应用于通过文本、图形、音频、视频等方式向用户提供内容生成服务的AI服务提供者。
- 适用于进行安全评估的提供商,以及相关监管机构。
二、服务提供方要求
- 安全目标: 建立网络安全基线,提升服务安全水平,重点关注网络安全、数据安全和个人信息保护。
- 服务风险控制: 涵盖服务全周期的风险预防和缓解,包括应用场景、软硬件环境、生成内容和权益保护等方面。
- 通用安全要求:
- 人员与场景: 需证明AI在特定场景(如关键信息基础设施、医疗、金融、未成年人服务)下的适用性与安全程度。
- 场景与用途: 需论证不同服务领域中使用AI的必要性、适用性和安全性,特别是高风险场景需加强保护(例如,防止未成年人沉迷、禁止向未成年人提供不符其民事行为能力的付费服务)。
- 透明度: 需公开服务对象(群体)、应用场景(语境)和用途信息(如标注在界面、协议或接口文档中)。
- 供应链安全: 要求评估用于训练和推理的计算系统中所使用的芯片、软件、工具的供应链安全性。
- 环境隔离: 模型训练环境和推理环境应分离(物理或逻辑隔离),以防数据泄露。
- 模型训练与升级: 需制定安全更新升级策略,并进行安全评估;对开源框架及自研代码进行安全审计。
- 安全监测与运维: 建立应急管理体系,持续监控模型输入,防范注入、后门、窃取、对抗性攻击等;建立监控评估方法及时优化模型。
- 服务稳定: 建立备份机制和恢复策略。
- 用户输入与训练: 用户应有权选择是否将其输入用于训练;需明确关闭此功能的方法,并便于操作。
- 隐私保护: 使用包含个人信息的训练数据需获得用户同意,并遵守相关法规。在服务中收集的个人信息(如果允许)需明示用途,并建竊聰投诉渠道和处理机制。
- 拒绝回答机制: 规范构建拒绝回答和不应拒绝回答的题库,并进行评估,确保模型能有效阻挡非法/不健康信息,拒绝极端问题、诱导非法信息的问题,但不拒绝合理查询,并定义其范围(如涉及政治文化、国家英雄等核心内容时不应拒绝)。
- 监控人员配置: 需配备监控人员基于监控结果指导模型优化,并根据服务规模定员。
三、关键安全要求领域
- 培训数据安全: 这是重中之重。
- 来源管理: 要求对数据源进行安全评估。
- 如果单一来源数据量超集合数据总量的5%,且违法信5 %。
- 收集后验证,如果违法信息超5%则不能用。
- 具体:对于国内来源,需合法来源;引用开源数据需有授权;自己收集的数据需有记录,不得盗取。
- 进口数据需与国内来源合理匹配(多元化),并且如果使用境外数据需有国内数据备份。
- 训练数据中如果包含需禁止的AI自我监督模式风险内容(框安附录A列出的31类风险),需进行过滤和管理,并标注安全风险等级。
- 内容过滤: 所有类型的数据(文本、图铃音视)在训练前必须进行过滤。
- 过滤方法:关键词过滤、分类模型(要求覆盖31种风险类型)、人工抽检。
- 禁止使用的数据:包含非法不健康内容的数据、未获授权的数据(如受.robotsexclusion协议保护的网页)。
- 数据标注安全: 对注释人员有要求,需培训、考核,并保持数据隔离存储。
- 知识产权保护: 需识别训练数据中的侵权风险;禁止使用侵权数据;建立管理策略和投诉处理渠道。
- 个人信息处理: 需获得同意,遵守法规,并保护个人数据安全。
- 商业规范: 禁止商业违规行为。
- 模型输出安全:
- 准确性: 输出内容应符合用户意图,与科学/主流认知一致。
- 可靠性: 输出格式合理,信息有效,有助于用户。
- 内容生成安全: 内容不得包含非法、不健康的31种风险类型。
- 模型安全: 模型生成的内容本身需满足安全要求。
- 来源管理: 要求对数据源进行安全评估。
四、评估与工具
- 标准通过设立评估要求和详述评估过程来规范安全实现。
- 关键评估需覆盖:
- 培训数据安全性(抽样检验合格率)。
- 模型生成内容安全性(基于测试题库评估合格率)。
- 模型拒答与非拒答行为是否符合设定。
- 工具性条款:
- 关键词库: 标准附录鼓励建立全面的(达到一定词条数量)安全性,但不影响主体内容,评估要求还在起草中)。
- 标注规则: 文本中出现。
- 试题库: 分别构建了全面覆盖安全风险的生成内容测试题库(2000题+)和拒答问题测试题库(要求达到500题以上),并要求不低于90%或95%的合格率。
总结:该标准是中国为生成式AI服务设立的国家层面安全规范,旨在从训练到服务全链条防范风险,特别是针对反对国家利益、社会稳定的言论以及知识产权、隐私等保护,提出了明确、量化的安全要求和评估方式,强调了服务伦理和社会责任。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载