兰德-人类和人工智能未来的相互依赖和脆弱性(英)-2025_43页_541kb
报告摘要
人类与人工智能相互依赖及脆弱性研究报告总结
本报告探讨了人类与强大人工智能系统在相互依赖和脆弱性条件下的共存方式,提出了一种替代现有AI安全范式的分析框架和政策建议。
主要观点
-
对齐范式的局限性
- 技术不确定性:人类价值观复杂且难以形式化,学习方法存在根本缺陷,无法保证AI始终符合价值观。
系统性风险:现有方法未解决社会层面问题(如财富分配、治理、国际合作)。
伦理担忧:可能造成文化专制、侵犯道德多元化,尤其当AI获得巨大权力时。
- 技术不确定性:人类价值观复杂且难以形式化,学习方法存在根本缺陷,无法保证AI始终符合价值观。
-
相互依赖与脆弱性的框架
- 建立了分析框架,认为互惠依赖超过了纯粹的技术对齐。
- 从生态、地缘政治和技术历史中汲取洞见:
- 生态学:互惠关系通常发生于互补角色;系统性脆弱性可有效防止单方面控制。
- 地缘政治学:权力平衡、可核查承诺和替代选项对于稳定至关重要。
- 技术史:自动化技术不如增强技术可持续,后者更容易促进渐进式适应。
-
AI与人类的双重依赖性
- 人类对AI的依赖:
- 关键决策、认知/情感需求、AI系统的高拆卸成本。
- AI对人类的依赖:
- 开发部署的选择权(人类保持是否推进AI的决策权)。
- 物理维护与能源需求。
- 道德框架和目标意义的输入。
- 人类对AI的依赖:
-
三项核心政策:
- (1) 发展非授权AI紧急关机机制:通过设计物理系统和关机协议,确保人类在紧急情况下能够行动。
- (2) 国际合作应对共享风险:鼓励全球合作分享AI脆弱性信息,减少军备竞赛,确保冗余资源。
- (3) 建设人类韧性,降低对AI依赖:投资为人关键技能(尤其是理论、政策专业化),在技术/治理中强调人类中心,通过教育确保具备基础能力。
-
建立技术/社会契约
- 通过相互依赖和脆弱性建立新型治理框架,平衡不同利益相关方的权利和义务,避免专制控制。
该报告呼吁平衡效率与韧性,自动化与人类能力,以及集中决策与分散监督,以实现安全且互利的人类与AI共存,特别重视物理层面上的操作控制作为不受AI左右的最后手段。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载