
AI正在变得越来越聪明,但"聪明"本身并不等于"安全"。
2026世界人工智能大会暨人工智能全球治理高级别会议上,这一议题被推到了行业讨论的中心。7月17日发布的《主席声明》明确提出,要重视人工智能带来的安全风险,推动构建法律法规、技术监测、风险预警、应急响应等治理体系。"为人工智能大模型加装必要护栏",这句话的背后,折射出人工智能发展的清晰信号:AI不仅需要持续提升能力,也需要建立与之匹配的安全治理体系。
从全球治理共识到产业实践探索,网易智企举办“用可信AI构建企业新智生产力”专题论坛。网易智企副总经理朱浩齐围绕《AI安全:从内容安全到AGI和具身智能安全》主题展开分享,结合网易智企长期在安全领域的实践,探讨AI从技术创新走向产业应用过程中,企业如何建立更加可靠、可持续的安全治理体系。
“
技术本身没有好坏,但它越来越像一把锋利的双刃剑。企业想要真正释放AI价值,就必须同步建立可靠的安全防护能力,让AI在可控、可信的边界内服务业务。
”

AI Agent时代,内生风险与权限失控是最大挑战
论坛上一个引发广泛共鸣的视角是:将AI Agent理解为新入职的"数字员工"。这个员工聪明、勤奋,能处理大量任务,也可能拥有较高权限。但正因如此,企业更需要思考:该给它什么权限?它的行为是否可记录?发生异常时能否及时阻断?
多个公开案例已经敲响警钟:攻击者通过AI客服流程绕过账号安全机制完成高价值账号接管;安全研究显示AI Agent具备自主侦察、执行攻击和发起勒索流程的潜在能力。这些案例说明,AI不再只是内容生成工具,而正在进入业务流程和权限系统。最大的风险不是AI不工作,而是它工作得太快、权限太大、过程不可见。这与WAIC《主席声明》中"明确决策权限和行为边界,建立行为追溯和风险提示机制"的要求形成了精准对应。
与此同时,大模型的内生风险同样不容忽视。大模型基于海量数据训练,在学习知识的同时,也可能吸收了危险知识、攻击方法、违规内容生成方式和错误价值倾向。一个典型案例是:某企业使用历史数据训练模型筛选简历,结果模型在推荐高管候选人时倾向于男性,造成明显的性别偏见。模型本身并不知道这是歧视,它只是从历史数据中学习到了某种统计相关性。大模型基于概率预测的本质,与企业场景中对确定性、合规性和道德约束的要求之间,天然存在张力,仅靠模型自身训练不足以解决安全问题。

越强的智能,越需要独立的安全控制面
在AI快速发展的过程中,一个重要问题正在被行业重新认识:安全是否可以完全依赖模型自身解决?
答案是否定的。
大模型通过海量数据训练获得强大的理解、推理和生成能力,但其本质仍然是基于概率预测的系统。模型能力越强,并不意味着其天然具备稳定、确定和可控的安全能力。一方面,大模型在学习知识的过程中,也可能接触到错误信息、危险知识或潜在偏见;另一方面,现实业务中的风险变化速度远远快于模型迭代周期,企业无法通过不断重新训练模型来应对所有新出现的问题。
因此,企业需要建立独立于模型之外的安全控制能力。
朱浩齐用“大脑”与“缩手反应”这一有趣的比喻生动诠释了二者的关系:大模型更像人的“大脑”,负责复杂认知、推理和创造;而安全能力更像“脑干”,负责在风险出现时快速识别并做出防护。二者并不是替代关系,而是协同关系。当企业面对提示词注入、敏感信息泄露或者异常调用行为时,并不一定需要重新训练模型,而是可以通过独立安全层快速识别风险、调整策略并进行阻断。

Google DeepMind近期发布的AI Control Roadmap也印证了同一方向:AI安全不能只依赖"对齐"。越复杂的系统,越做不到绝对零错误。即便模型经过了充分的对齐训练,在架构设计上也必须假设它可能出错甚至失控。重点不再是"怎么让它永远不犯错",而是"它一旦犯错,系统如何拦截"。因此,系统级防护、权限控制和持续监测正在成为与模型训练同等重要的安全手段。AI安全正在从"让模型本身更安全",扩展到"让AI进入业务系统后仍然可控",这是一种重要的安全思考范式转变。
与此同时,AI安全也需要更加专业、独立的第三方能力支撑。
从社会信任角度看,模型厂商自己说自己安全是不够的,就像安全座椅需要独立检测报告一样,AI系统也需要更透明、更独立的安全机制来支撑信任。第三方安全服务还具备"群体免疫"效应:一个安全问题一旦被识别并形成策略,所有接入同一安全服务的客户都可以更快获得防护能力。
正如朱浩齐所比喻的:"安全是高速公路上的护栏,只有护栏足够可靠,AI这辆快车才能跑得更快、更远。"
从数字内容风控到AI安全治理,持续拓展安全边界
面对AI时代新的安全挑战,网易智企正在将长期积累的安全能力延伸至大模型和智能体场景。
在大模型应用快速落地的过程中,企业首先需要解决的是AI内容交互过程中的安全问题。围绕这一需求,网易智企持续建设大模型安全围栏能力,其核心是抓住大模型与外部世界交互的关键节点,通过覆盖输入、输出以及交互过程的安全检测机制,帮助企业识别提示词攻击、越狱风险、敏感信息泄露以及违规内容生成等风险。
通过双轨自适应训练机制,将大模型能力蒸馏到更轻量、更高性能的小模型中,结合低成本、高性能的检测手段实现快速安全响应,覆盖文本生成、图片生成、视频生成及智能体交互等多种AI场景,在不拖慢业务进度的前提下,让安全能力实时嵌入AI应用流程。

未来,随着智能体将越来越多地参与企业生产活动,Agent带来的风险也将从内容层进一步扩展到行为层。例如,智能体是否调用了不必要的数据资源,是否执行了超出授权范围的操作,是否受到外部指令干扰导致任务目标偏移,都成为企业必须面对的新问题。
基于这一趋势,网易智企进一步探索面向Agent时代的安全治理能力,从工具调用、权限控制、任务执行、行为审计等环节出发,帮助企业建立更加完整的智能体安全防护体系。
IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

