图片

 

7月17日,《2026世界人工智能大会暨人工智能全球治理高级别会议主席声明》发布。在这份讨论人工智能创新、应用、安全与全球合作的文件中,有一句话格外具体:为人工智能大模型加装必要护栏。

 

外交部发布的《主席声明》

2026世界人工智能大会暨人工智能全球治理高级别会议主席声明(全文)

当“护栏”被写入一份面向全球人工智能治理的重要文件,它所指向的已经不只是某项安全技术,而是一个越来越现实的问题:当大模型从生成内容走向调用工具、访问数据乃至执行任务,我们如何确保,一个能力不断增强的智能系统,始终运行在人类能够理解、控制和承担责任的边界之内?

 

从治理原则,走向工程机制

 

理解“必要护栏”,不能脱离《声明》的上下文。

《声明》先提出风险导向、敏捷治理和分类分级管理,要求构建技术监测、风险预警、应急响应体系;随后明确提出为大模型加装必要护栏;在谈到智能体时,又进一步强调决策权限、行为边界、行为追溯和风险提示机制。

从风险治理,到大模型护栏,再到智能体行为边界,这组连续表述释放出一个清晰信号:人工智能治理正在从原则共识走向可操作、可验证的工程机制。

此前提到护栏,很多人的第一反应是敏感词过滤,或者在输出之后增加一次内容审核。但《声明》里的护栏,远比这复杂。

从工程角度看,大模型护栏是一组部署在AI与真实世界交互边界上的动态安全机制。它需要对模型的输入、生成、输出以及外部调用进行持续判断,并根据风险等级采取放行、提示、复核、限制或阻断等不同动作。

这很像高速公路上的护栏。它的目的不是让车辆停下来,而是划定边界,在发生偏移时提供提醒和保护,避免一次失控演变成不可承受的后果。

对于AI同样如此。真正有效的护栏,更应帮助能力在清晰、可信的边界内释放。衡量一套护栏是否成熟,不能只看它“拦住了多少”,还要看它能否理解场景、区分风险,并在安全、效率与体验之间进行细粒度治理。

 

全球厂商怎样给AI加护栏?

 

梳理主流模型与云平台厂商的公开实践,可以看到三条正在汇合的路线:把安全规则训练进模型,在模型外部署运行时检测与控制,以及通过风险评估决定模型能否、以何种方式上线。多数厂商并非三选一,而是叠加使用。

注:以上依据各厂商截至2026年7月公开发布的官方框架、产品文档与研究资料整理。不同厂商的产品边界和披露口径并不完全一致,表格用于呈现技术路线,不作能力排名。

这些路线虽然各有侧重,却呈现出四个共同方向:

  • 从模型内部走向模型外部。越来越多平台提供可独立调用、可配置阈值、可记录日志的运行时安全层。
  • 从单点过滤走向纵深防御。模型训练、输入输出检测、权限控制、运行监测和发布治理开始叠加。
  • 从内容安全走向行为安全。治理对象正在由“说了什么”扩展到“调用了什么工具、访问了什么数据、执行了什么动作”。
  • 从一次评测走向持续运营。护栏需要在误拦截、漏拦截、业务体验和新型攻击之间不断校准。

这也说明,衡量护栏是否成熟,不能只看规则数量或单次测试分数,更要看它能否覆盖关键交互节点,能否与业务权限联动,能否持续评测和更新,以及能否留下可审计、可复盘的记录。

 

为什么仅靠模型自审,还不够?

 

大模型的安全训练和内生对齐,是AI安全的基础,但把全部安全责任交给模型自身并不现实。

一个根本原因在于,大模型本质上是概率系统,而企业生产环境追求稳定、确定和可追溯。模型可以根据上下文给出最可能的回答,却很难天然理解每一家企业的业务红线、权限体系和责任边界。

同时,风险变化往往快于模型重新训练和发布。新的攻击方式、黑灰产话术、突发事件与监管要求不断出现。如果每次变化都依赖重新训练,不仅成本高、周期长,也难以满足业务的实时需要。

网易智企-易盾业务总经理朱浩齐

《WAIC2026:可信AI构建企业新智生产力》论坛上,网易智企-易盾业务总经理朱浩齐将这种关系做了一个形象类比:人的大脑负责复杂认知与推理,但当手碰到火、危险迎面而来时,身体不会等待一轮复杂分析,而是通过更快速的反射机制先作出保护动作。

AI安全也需要这种“脑干反射”。

模型继续承担理解、生成和推理,但在它与外部世界交互的关键节点,还需要一套相对独立的机制,负责快速识别风险、执行策略,并在必要时阻断危险行为。前者提高AI自身的安全能力,后者则根据真实业务、实时风险和责任边界,提供持续更新的外部约束。

 

安全≠零风险承诺

 

《声明》没有给出一份具体的护栏技术清单。但将第七至第九条连起来看,它至少明确了几项基本要求:建立技术监测、风险预警与应急响应体系,实施分类分级管理,确保前沿模型安全部署,并为智能体划定决策权限和行为边界、建立行为追溯机制。

在这些要求之上,结合大模型的技术特点和易盾的安全实践,一套能够真正进入生产环境的护栏,还需要回答三个问题:它能否独立于模型进行安全判断?能否在关键环节及时响应?又能否随着风险变化持续更新?

在长期安全实践中,易盾越来越清楚地看到:安全不是一个可以一次性完成的项目。

风险、业务、用户行为以及模型能力都在变化。可靠的安全体系,不能建立在“永远不出问题”的承诺上,而应建立在持续识别、快速响应、有效处置和责任可追溯的能力之上。

这也是为什么,安全必须进入真实业务场景。金融、教育、游戏、社交等行业,对风险的容忍度、处置方式和业务体验有着不同要求。脱离场景的统一规则,很难同时兼顾安全与发展。只有真正理解业务运行方式,护栏才能成为可用的治理能力,而不是悬在系统之外的一道形式要求。

从这个意义上说,“必要护栏”不仅是一项技术主张,也是一种治理方法:不迷信模型自身能够解决一切问题,不用绝对安全的口号掩盖不确定性,而是承认风险、理解风险,再通过持续运行的机制把风险控制在可承受、可处置的范围内。

 

护栏是AI进入世界的基础设施

 

今天,企业已经不再满足于让AI完成问答、检索和内容生成,而是希望它进入客服、研发、运营、数据分析等核心流程。

但如果权限无法控制、过程无法记录、异常无法阻断,企业就很难放心把核心数据和关键任务交给AI。许多AI应用无法从演示走向生产,缺少的未必是模型能力,而是与能力相匹配的安全边界。

发展与安全并不是一道非此即彼的选择题。护栏也不是AI创新的刹车。恰恰相反,它是企业敢于开放更多场景、交付更多权限、承担更复杂任务的前提。

成熟的AI治理,并不要求技术永远不犯错,而是确保错误不会无边界扩散,风险始终能够被发现、控制和追溯。

这或许正是“必要护栏”成为全球AI治理关键词的深层原因:我们需要的不只是更强的人工智能,也需要一种让这种力量长期、稳定、负责任地服务人类的能力。