8月9日,2026年网络安全技术创新与人才教育大会在长沙举行。主论坛上,《人工智能安全监管保险箍模式》蓝皮书(下称“蓝皮书”)正式发布。蓝皮书由广州大学牵头,国防科技大学、哈尔滨工业大学(深圳)等多所高校参编。中国工程院院士、广州大学网络空间先进技术研究院院长方滨兴担任领衔专家,国防科技大学贾焰教授担任指导专家组组长,齐佳音教授研究团队作为主要研究和撰写力量参与完成。

《人工智能安全监管保险箍模式》蓝皮书发布
7月17日,习近平主席在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上指出,人工智能应当成为人类的可信工具,并强调要“强化风险意识,确保安全可控”,推动法律法规、技术监测、风险预警、应急响应体系建设,筑牢安全底线。
据悉,人工智能安全监管“保险箍”研究并非一时之议。方滨兴院士研究团队较早开展人工智能安全研究,并在2020年出版的《人工智能安全》第八章系统论述了“人工智能行为体保险箍”。经过持续迭代,这一构想由理论研究逐步走向系统实践。
当人工智能从“会回答问题”转向“会拆解任务、会调用工具、会持续行动”,安全问题也随之改写。风险不再只是一句错误回答,而可能沿决策链、调用链、执行链和协作链进入现实世界。蓝皮书由此提出四个追问:偏离能否看见,逼近红线能否收紧,冲撞红线能否熔断,风险发生后能否追溯?
为回答这些问题,蓝皮书在人工智能能力系统之外设置独立安全边界,将最终裁决权与能力系统适度分离。平时像“紧箍咒”,持续约束能力、权限、任务和行为;关键时刻像“保险丝”,触发降级、暂停、断能、回滚或人工接管。全过程由SARPPR动态闭环支撑,贯通感知、分析、响应、策略、防护和恢复,并形成内生安全、内置安全、外置安全三层防线。
蓝皮书的三个亮点,可以概括为把问题讲透、把框架立住、把方案做实。一是从机理上回答风险为何客观存在;二是构建“SARPPR闭环+三层安全”治理框架;三是面向大模型、智能体和具身智能提出差异化方案,把安全闸门分别设在内容交付、动作生效和现实执行之前。

《人工智能安全监管保险箍模式》蓝皮书
蓝皮书认为,人工智能安全不能只靠倡议,还要有装置和手段;“保险箍”不是束缚创新,而是在能力与后果之间加一道可靠闸门,让人工智能始终可理解、可干预、可追责。
目前,相关方案已在大模型安全运营平台和智能体动作裁决系统中进行验证。面向未来,团队将继续推进理论研究、标准规范和测试评估,推动“保险箍”成为可部署、可验证、可监管的安全基础设施。