一、开场:AI时代,安全成为企业创新的必要条件
大家好,我是朱浩齐,网易智企-易盾业务总经理。我从事安全业务已经17年,过去这些年里,我们持续对抗过垃圾邮件、外挂、盗号、黑灰产欺诈等多种风险形态。
一路走来,我最大的感受是:技术本身没有好坏,但它越来越像一把锋利的双刃剑。尤其进入AI时代,技术能力正在爆发式增长。企业要真正把AI用起来,就必须同步建立可靠的安全防护措施,让AI能力在可控、可信的边界内服务业务。
二、易盾的安全能力来自真实业务场景
简单介绍一下易盾。易盾孵化于网易集团,并在2016年正式对外提供服务。最初,我们是把网易内部各类业务打磨出来的安全能力,沉淀成可对外服务的产品体系。
这些能力包括:垃圾内容如何处置、违规信息如何识别、有害账号如何发现、业务风险如何提前拦截等。它们听起来像是一个个具体功能,但背后实际涉及用户体验、行业特征和业务风险之间的复杂平衡。
安全能力只有真正嵌入行业场景,才能发挥效果。比如游戏和社交场景更关注内容可控,传媒和零售行业更关注信息真实性,金融和教育场景则更关注数据安全和用户隐私。
因此,安全不是一刀切的服务,也不是提供一个接口就能解决的问题。它需要结合行业场景持续运营和调优,所以我们一直认为,安全是一个重售后、重运营、重场景理解的业务。
三、把AI Agent看作“数字员工”
今天我们讨论AI安全,可以先把AI Agent理解成一个新入职的数字员工。这个员工很聪明、很勤奋,能够处理大量任务,也可能拥有较高权限。但正因为它能做很多事,企业更需要思考:该给它什么权限?它的行为是否可记录?发生异常时能否及时阻断?
公开报道中已经出现过一些典型案例。例如,有攻击者通过AI客服流程绕过账号安全机制,完成高价值账号接管;也有安全研究显示,AI Agent具备自主侦察、执行攻击和发起勒索流程的潜在能力。这些案例说明,AI不再只是内容生成工具,而正在进入业务流程和权限系统。
当企业引入越来越多这样的“数字员工”时,最大的风险不是它们不工作,而是它们工作得太快、权限太大、过程不可见。一旦缺少约束,企业就很难知道AI到底在访问什么、调用什么、改动什么。
四、AI安全正在成为国家、企业和社会共同关注的问题
从国家和政府层面看,AI治理正在快速推进。根据斯坦福大学及相关政策研究机构的统计,2016年至2026年间,G20国家已经发布了数百部AI相关法律法规和规章制度,其中相当一部分集中在近三年发布。欧盟《人工智能法案》等法规也进一步提高了AI安全与合规要求。
从企业层面看,OpenAI在2026年7月发布了国家安全伙伴关系相关原则,Anthropic也发布了Advanced AI Framework等安全治理框架。可以看到,头部AI企业正在持续强化对技术安全、责任边界和治理机制的公开说明。
从学术和国际组织层面看,联合国人工智能独立国际科学小组等机构也在强调,当前AI系统仍然存在透明度不足、防护机制不充分等问题,需要在AI全生命周期中引入更明确的安全治理机制。
这意味着,AI安全已经不只是模型厂商自己的问题,而是国家安全、企业责任和社会信任共同关注的焦点。
五、大模型安全既有外部风险,也有内生风险
大模型基于海量数据训练而成,在学习知识的同时,也可能吸收了大量危险知识、攻击方法、违规内容生成方式和错误价值倾向。因此,大模型安全不仅来自外部攻击,也来自模型自身的内生风险。
举个例子,曾有企业使用历史数据训练模型来筛选简历,结果模型在推荐高管候选人时倾向于男性,造成了明显的性别偏见。模型本身并不知道这是歧视,它只是从历史数据中学习到了某种统计相关性。
这说明,大模型基于概率预测的本质,与很多企业场景中对确定性、合规性和道德约束的要求之间,天然存在张力。
六、为什么需要独立于模型之外的安全防护层
有人可能会问:只要把大模型训练得更聪明、更精准,是不是就能解决安全问题?这当然很重要,但仅靠模型自身训练并不够。
自然界给了我们一个很好的类比。人的大脑既有负责复杂逻辑和高认知推理的大脑皮层,也有负责本能反应和快速防护的脑干层。当手碰到火、眼前有危险物体飞来时,身体不会等待复杂思考,而是迅速完成反射动作。
AI安全也需要类似机制。我们需要一个独立于大模型自身能力之外的安全网关层,把安全能力嵌入每一个关键检测节点,在风险出现时快速识别、快速响应。
原因在于,现实世界的风险变化太快,而大模型训练成本高、周期长,依靠重新训练来应对所有新风险并不现实。比如高考期间,大模型需要限制回答相关敏感问题,不可能在短时间内重新训练一遍模型。此时,一个独立的安全策略层就可以快速上线针对性策略,帮助模型在特定场景下保持合规。
七、第三方安全服务的价值:独立、专业、可持续
从社会信任角度看,模型厂商自己说自己安全是不够的。就像我们购买安全座椅,不会只听厂商自证安全,还会关注检测报告和第三方评测。AI系统也是一样,需要更透明、更独立的安全机制来支撑信任。
大模型本身是概率系统,而安全治理追求的是稳定、确定和可追溯。仅依赖模型自身实现安全,存在天然风险。因此,独立安全服务可以作为模型外部的补充防线,帮助企业形成更稳健的治理体系。
同时,第三方安全服务还具备群体免疫效应。一个安全问题一旦被识别并形成策略,所有接入同一安全服务的客户都可以更快获得防护能力。例如在高考场景中,易盾可以统一上线相关防护策略,帮助接入方在不关闭问答能力的情况下,实现针对性风险识别和控制。
对于企业来说,自研安全体系需要持续投入大量人力、预算和技术资源。而引入经过市场验证的专业安全服务,可以帮助企业降低自研成本,提升风险治理的专业性、稳定性和可追溯性。
八、安全不是“零风险承诺”,而是持续治理能力
安全领域无法承诺绝对零风险。无论是大型模型厂商,还是投入很高的技术团队,都不可能保证百分之百不出问题。
关键不在于宣称“永远不会出问题”,而在于企业是否具备持续识别、快速响应、有效处置和责任可追溯的能力。经过市场竞争和真实客户验证的安全服务,往往更能支撑长期稳定发展。
这也是易盾从网易内部安全能力走向企业服务的重要原因。技术能力不能只在实验室或内部汇报中自证有效,必须放到真实市场、真实客户和真实攻击对抗中接受验证。
九、AI Control Roadmap带来的范式变化
近期,Google DeepMind发布了AI Control Roadmap,其中一个重要变化是:AI安全不能只依赖“对齐”。越复杂的系统,越不应假设它永远不会犯错,而是要通过系统级防护、权限控制和持续监测来降低风险。
这与企业管理数字员工的逻辑类似。一个新员工再聪明,也不可能一入职就拥有全部系统权限。企业需要控制它能访问什么、能操作什么、行为是否被记录、异常时能否及时熔断。
因此,AI安全正在从“让模型本身更安全”,扩展到“让AI进入业务系统后仍然可控”。这是一种重要的安全思考范式转变。
十、内容是AI安全治理的重要抓手
对于易盾来说,内容是AI安全治理中非常重要的抓手。内容连接算法世界和真实世界,是用户最直观感知AI结果的接触点,也是合规治理中最容易被观察、被评估、被处置的环节。
无论是国内的生成式人工智能服务管理相关规定,还是欧盟《人工智能法案》等海外监管框架,都会对AI生成内容、输出风险和用户影响提出要求。因此,围绕输入、输出和交互内容建立安全防护,是企业AI治理的基础环节。
在实践中,易盾会持续建设自身的安全大模型和策略体系,也会对不同模型在安全任务上的召回率、准确率和稳定性进行横向评估。不同模型在安全能力上存在差异,因此需要结合业务场景选择更合适的模型能力,并通过专业安全策略进一步增强效果。
十一、易盾的大模型安全围栏实践
易盾的大模型安全围栏,核心是抓住大模型与外部世界交互的关键节点,在每一个输入、输出和调用环节中进行实时检测和处理。
面对海量内容和复杂风险,仅依赖安全专家人工处理是不现实的。因此,易盾也在积极拥抱AI,建设双轨自适应训练机制,把大模型能力蒸馏到更轻量、更高性能的小模型中,并结合低成本、高性能的检测手段,实现像“脑干反射”一样的快速安全响应。
这套机制可以应用于多种AI场景,包括文本生成、图片生成、视频生成、智能体交互等。目标是在不显著拖慢业务进度的前提下,让安全能力实时嵌入AI应用流程。
十二、AI安全是业务加速的护栏
很多企业会担心:安全会不会拖慢AI业务进度?事实上,如果一个Agent没有权限控制,只能停留在Demo阶段;如果业务流程无法记录、无法审计、无法追溯,企业也很难放心把核心数据和核心流程交给AI。
如果一个AI系统没有应急熔断机制,某一次错误调用就可能造成严重业务影响。因此,安全不是AI发展的绊脚石,而是企业把AI真正推向生产环境的必要条件。
可以把AI安全理解为高速公路上的护栏。只有护栏足够可靠,AI这辆快车才能跑得更快、更远。
十三、白皮书发布:构建看得见、管得住、测得出、追得回的AI安全体系
结合易盾自身实践,以及前面提到的AI安全理念,网易智企-易盾联合金山办公和MakeNex发布了AI安全相关白皮书。
这份白皮书希望帮助企业构建一个看得见、管得住、测得出、追得回的AI安全体系,让企业能够结合自身业务场景,逐步建立可落地的安全治理能力。
接下来,也请易盾安全策略研究专家继续介绍白皮书的核心内容。
白皮书核心内容介绍
这份白皮书结合了易盾长期以来的AI安全治理经验,以及十多年数字内容风控经验和技术沉淀,核心目标是沉淀治理方法,理清AI行业发展的安全内核,并进一步提供可落地的合规治理体系。
一、十个核心观点与六大趋势洞察
白皮书首先提出了十个核心观点和六大趋势洞察,重点围绕AI行业安全发展的趋势展开。
这些洞察结合了技术、产业、风险和全球治理的综合研判。例如,AI攻击正在进入自动化阶段,多模态和具身智能的发展也会带来新的风险形态。我们希望通过这些趋势研判,为行业后续业务布局和安全主动防御提供参考。
二、全球AI安全监管趋势与中国治理模式
第二个模块聚焦全球AI安全监管政策。监管政策连接技术创新与社会福祉,因此企业在推进AI应用时,必须同步关注合规要求。
从全球看,AI监管正在呈现五大趋势:监管节奏加快、风险分级成为共识、安全要求工程化、地区差异长期存在、合规治理从原则走向落地。在此基础上,中国也在逐步形成具有自身特点的AI安全治理模式。
三、风险分析体系与安全合规成熟度模型
基于前期政策研究、风险分析和技术行业研究,白皮书提出了两个体系。
第一个是AI风险分析体系。我们从数据层、模型层、应用层、智能体层和生态层五个维度,对AI相关风险进行分类分析。
风险识别之后,还需要判断风险优先级。白皮书结合风险发生概率、影响程度、检测发现难度、修复治理成本和扩散能力五个维度,对风险进行优先级评估,最终形成三级优先级。
这一体系的主要作用是:当企业安全资源有限,包括预算、人力和技术资源都有限时,可以帮助企业确定优先防控顺序,先处理最关键、最紧迫的风险。
第二个体系是AI安全合规成熟度模型。该模型在易盾原有数字内容风控成熟度模型基础上,结合AI安全实践进一步扩展而来。
成熟度模型主要包括三个维度:第一是通用治理能力,包括组织建设、制度流程和责任机制;第二是业务层面的治理能力,包括数据控制面、模型控制面和应用控制面的安全治理;第三是产品服务全生命周期治理,覆盖AI产品从设计、开发、测试、上线到运营的完整过程。
四、AI安全不是绊脚石,而是压舱石
我们认为,AI安全不应该成为企业创新的绊脚石,而应该成为产业高质量发展的压舱石。
未来,希望能够携手行业伙伴和产业链上下游,共建AI合规体系,迈向可信AI时代,共建智能向善的未来。
谢谢大家。

IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

