7月17日,《2026世界人工智能大会暨人工智能全球治理高级别会议主席声明》发布。在这份讨论人工智能创新、应用、安全与全球合作的文件中,有一句话格外具体:“为人工智能大模型加装必要护栏。”

外交部发布的《主席声明》
2026世界人工智能大会暨人工智能全球治理高级别会议主席声明(全文)
当“护栏”被写入一份面向全球人工智能治理的重要文件,它所指向的已经不只是某项安全技术,而是一个越来越现实的问题:当大模型从生成内容走向调用工具、访问数据乃至执行任务,我们如何确保,一个能力不断增强的智能系统,始终运行在人类能够理解、控制和承担责任的边界之内?
从治理原则,走向工程机制
理解“必要护栏”,不能脱离《声明》的上下文。
《声明》先提出风险导向、敏捷治理和分类分级管理,要求构建技术监测、风险预警、应急响应体系;随后明确提出为大模型加装必要护栏;在谈到智能体时,又进一步强调决策权限、行为边界、行为追溯和风险提示机制。
从风险治理,到大模型护栏,再到智能体行为边界,这组连续表述释放出一个清晰信号:人工智能治理正在从原则共识走向可操作、可验证的工程机制。
此前提到护栏,很多人的第一反应是敏感词过滤,或者在输出之后增加一次内容审核。但《声明》里的护栏,远比这复杂。
从工程角度看,大模型护栏是一组部署在AI与真实世界交互边界上的动态安全机制。它需要对模型的输入、生成、输出以及外部调用进行持续判断,并根据风险等级采取放行、提示、复核、限制或阻断等不同动作。
这很像高速公路上的护栏。它的目的不是让车辆停下来,而是划定边界,在发生偏移时提供提醒和保护,避免一次失控演变成不可承受的后果。
对于AI同样如此。真正有效的护栏,更应帮助能力在清晰、可信的边界内释放。衡量一套护栏是否成熟,不能只看它“拦住了多少”,还要看它能否理解场景、区分风险,并在安全、效率与体验之间进行细粒度治理。
全球厂商怎样给AI加护栏?
梳理主流模型与云平台厂商的公开实践,可以看到三条正在汇合的路线:把安全规则训练进模型,在模型外部署运行时检测与控制,以及通过风险评估决定模型能否、以何种方式上线。多数厂商并非三选一,而是叠加使用。

注:以上依据各厂商截至2026年7月公开发布的官方框架、产品文档与研究资料整理。不同厂商的产品边界和披露口径并不完全一致,表格用于呈现技术路线,不作能力排名。
这些路线虽然各有侧重,却呈现出四个共同方向:
-
从模型内部走向模型外部。越来越多平台提供可独立调用、可配置阈值、可记录日志的运行时安全层。 -
从单点过滤走向纵深防御。模型训练、输入输出检测、权限控制、运行监测和发布治理开始叠加。 -
从内容安全走向行为安全。治理对象正在由“说了什么”扩展到“调用了什么工具、访问了什么数据、执行了什么动作”。 -
从一次评测走向持续运营。护栏需要在误拦截、漏拦截、业务体验和新型攻击之间不断校准。
这也说明,衡量护栏是否成熟,不能只看规则数量或单次测试分数,更要看它能否覆盖关键交互节点,能否与业务权限联动,能否持续评测和更新,以及能否留下可审计、可复盘的记录。
为什么仅靠模型自审,还不够?
大模型的安全训练和内生对齐,是AI安全的基础,但把全部安全责任交给模型自身并不现实。
一个根本原因在于,大模型本质上是概率系统,而企业生产环境追求稳定、确定和可追溯。模型可以根据上下文给出最可能的回答,却很难天然理解每一家企业的业务红线、权限体系和责任边界。

同时,风险变化往往快于模型重新训练和发布。新的攻击方式、黑灰产话术、突发事件与监管要求不断出现。如果每次变化都依赖重新训练,不仅成本高、周期长,也难以满足业务的实时需要。

网易智企-易盾业务总经理朱浩齐
在《WAIC2026:可信AI构建企业新智生产力》论坛上,网易智企-易盾业务总经理朱浩齐将这种关系做了一个形象类比:人的大脑负责复杂认知与推理,但当手碰到火、危险迎面而来时,身体不会等待一轮复杂分析,而是通过更快速的反射机制先作出保护动作。
AI安全也需要这种“脑干反射”。
模型继续承担理解、生成和推理,但在它与外部世界交互的关键节点,还需要一套相对独立的机制,负责快速识别风险、执行策略,并在必要时阻断危险行为。前者提高AI自身的安全能力,后者则根据真实业务、实时风险和责任边界,提供持续更新的外部约束。
安全≠零风险承诺
《声明》没有给出一份具体的护栏技术清单。但将第七至第九条连起来看,它至少明确了几项基本要求:建立技术监测、风险预警与应急响应体系,实施分类分级管理,确保前沿模型安全部署,并为智能体划定决策权限和行为边界、建立行为追溯机制。
在这些要求之上,结合大模型的技术特点和易盾的安全实践,一套能够真正进入生产环境的护栏,还需要回答三个问题:它能否独立于模型进行安全判断?能否在关键环节及时响应?又能否随着风险变化持续更新?
在长期安全实践中,易盾越来越清楚地看到:安全不是一个可以一次性完成的项目。
风险、业务、用户行为以及模型能力都在变化。可靠的安全体系,不能建立在“永远不出问题”的承诺上,而应建立在持续识别、快速响应、有效处置和责任可追溯的能力之上。
这也是为什么,安全必须进入真实业务场景。金融、教育、游戏、社交等行业,对风险的容忍度、处置方式和业务体验有着不同要求。脱离场景的统一规则,很难同时兼顾安全与发展。只有真正理解业务运行方式,护栏才能成为可用的治理能力,而不是悬在系统之外的一道形式要求。
从这个意义上说,“必要护栏”不仅是一项技术主张,也是一种治理方法:不迷信模型自身能够解决一切问题,不用绝对安全的口号掩盖不确定性,而是承认风险、理解风险,再通过持续运行的机制把风险控制在可承受、可处置的范围内。
护栏是AI进入世界的基础设施
今天,企业已经不再满足于让AI完成问答、检索和内容生成,而是希望它进入客服、研发、运营、数据分析等核心流程。
但如果权限无法控制、过程无法记录、异常无法阻断,企业就很难放心把核心数据和关键任务交给AI。许多AI应用无法从演示走向生产,缺少的未必是模型能力,而是与能力相匹配的安全边界。

发展与安全并不是一道非此即彼的选择题。护栏也不是AI创新的刹车。恰恰相反,它是企业敢于开放更多场景、交付更多权限、承担更复杂任务的前提。
成熟的AI治理,并不要求技术永远不犯错,而是确保错误不会无边界扩散,风险始终能够被发现、控制和追溯。
这或许正是“必要护栏”成为全球AI治理关键词的深层原因:我们需要的不只是更强的人工智能,也需要一种让这种力量长期、稳定、负责任地服务人类的能力。
IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

