为人工智能装上“保险箍” ——《人工智能安全监管保险箍模式》蓝皮书正式发布

作者:    时间:2026-08-10    点击数:

8月9日,2026年网络安全技术创新与人才教育大会在长沙举行。主论坛上,《人工智能安全监管保险箍模式》蓝皮书(下称“蓝皮书”)正式发布。蓝皮书由广州大学牵头,国防科技大学、哈尔滨工业大学(深圳)等多所高校参编。中国工程院院士方滨兴担任领衔专家,国防科技大学贾焰教授担任指导专家组组长,齐佳音教授研究团队作为主要研究和撰写力量参与完成。


图1 《人工智能安全监管保险箍模式》蓝皮书发布


7月17日,习近平主席在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上指出,人工智能应当成为人类的可信工具,并强调要“强化风险意识,确保安全可控”,推动法律法规、技术监测、风险预警、应急响应体系建设,确保人工智能始终处于人类控制之下。人工智能安全监管“保险箍”研究并非一时之议。方滨兴院士研究团队较早开展人工智能安全研究,并在2020年出版的《人工智能安全》第八章系统论述“人工智能行为体保险箍”。经过持续迭代,这一构想由理论研究逐步走向系统实践。

当人工智能从“会回答问题”转向“会拆解任务、会调用工具、会持续行动”,安全问题也随之改写。风险不再只是一句错误回答,而可能沿决策链、调用链、执行链和协作链进入现实世界。蓝皮书由此提出四个追问:偏离能否看见,逼近红线能否收紧,冲撞红线能否熔断,风险发生后能否追溯?

为回答这些问题,蓝皮书在人工智能能力系统之外设置独立安全边界,将最终裁决权与能力系统适度分离。平时像“紧箍咒”,持续约束能力、权限、任务和行为;关键时刻像“保险丝”,触发降级、暂停、断能、回滚或人工接管。全过程由SARPPR动态闭环支撑,贯通感知、分析、响应、策略、防护和恢复,并形成内生安全、内置安全、外置安全三层防线。

蓝皮书的三个亮点,可以概括为把问题讲透、把框架立住、把方案做实。一是从机理上回答风险为何客观存在。模型可以把分数做高,却未必把事情做对;目标确定,并不等于路径可控。当奖励信号不能完整表达人的真实目标和过程规范时,系统就可能选择回报更高却偏离安全边界的路径。二是构建“SARPPR闭环+三层安全”治理框架。内生安全从数据和训练源头降险,内置安全守住对齐、输入输出和工具调用过程,外置安全负责独立裁决和强制兜底;外置环节发现的问题还会反馈前两层,推动策略、数据和训练持续改进。三是面向大模型、智能体和具身智能提出差异化方案,把安全闸门分别设在内容交付、动作生效和现实执行之前:大模型守内容,智能体守动作与任务链,具身智能守现实执行,使候选内容、候选动作和候选任务链未经裁决不能直接产生现实后果。

目前,相关方案已在大模型安全运营平台和智能体动作裁决系统中展开验证。面向未来,团队将继续推进理论研究、标准规范和测试评估,推动“保险箍”成为可部署、可验证、可监管的安全基础设施。人工智能安全不能只靠倡议,还要有装置和手段;“保险箍”不是束缚创新,而是在能力与后果之间加一道可靠闸门,让人工智能始终可理解、可干预、可追责。


图2 《人工智能安全监管保险箍模式》蓝皮书封面


Copyright © 2022 广州大学网络空间安全学院 版权所有