一、开场:AI时代,安全成为企业创新的必要条件

大家好,我是朱浩齐,网易智企-易盾业务总经理。我从事安全业务已经17年,过去这些年里,我们持续对抗过垃圾邮件、外挂、盗号、黑灰产欺诈等多种风险形态。

一路走来,我最大的感受是:技术本身没有好坏,但它越来越像一把锋利的双刃剑。尤其进入AI时代,技术能力正在爆发式增长。企业要真正把AI用起来,就必须同步建立可靠的安全防护措施,让AI能力在可控、可信的边界内服务业务。

二、易盾的安全能力来自真实业务场景

简单介绍一下易盾。易盾孵化于网易集团,并在2016年正式对外提供服务。最初,我们是把网易内部各类业务打磨出来的安全能力,沉淀成可对外服务的产品体系。

这些能力包括:垃圾内容如何处置、违规信息如何识别、有害账号如何发现、业务风险如何提前拦截等。它们听起来像是一个个具体功能,但背后实际涉及用户体验、行业特征和业务风险之间的复杂平衡。

安全能力只有真正嵌入行业场景,才能发挥效果。比如游戏和社交场景更关注内容可控,传媒和零售行业更关注信息真实性,金融和教育场景则更关注数据安全和用户隐私。

因此,安全不是一刀切的服务,也不是提供一个接口就能解决的问题。它需要结合行业场景持续运营和调优,所以我们一直认为,安全是一个重售后、重运营、重场景理解的业务。

三、把AI Agent看作“数字员工”

今天我们讨论AI安全,可以先把AI Agent理解成一个新入职的数字员工。这个员工很聪明、很勤奋,能够处理大量任务,也可能拥有较高权限。但正因为它能做很多事,企业更需要思考:该给它什么权限?它的行为是否可记录?发生异常时能否及时阻断?

公开报道中已经出现过一些典型案例。例如,有攻击者通过AI客服流程绕过账号安全机制,完成高价值账号接管;也有安全研究显示,AI Agent具备自主侦察、执行攻击和发起勒索流程的潜在能力。这些案例说明,AI不再只是内容生成工具,而正在进入业务流程和权限系统。

当企业引入越来越多这样的“数字员工”时,最大的风险不是它们不工作,而是它们工作得太快、权限太大、过程不可见。一旦缺少约束,企业就很难知道AI到底在访问什么、调用什么、改动什么。

四、AI安全正在成为国家、企业和社会共同关注的问题

从国家和政府层面看,AI治理正在快速推进。根据斯坦福大学及相关政策研究机构的统计,2016年至2026年间,G20国家已经发布了数百部AI相关法律法规和规章制度,其中相当一部分集中在近三年发布。欧盟《人工智能法案》等法规也进一步提高了AI安全与合规要求。

从企业层面看,OpenAI在2026年7月发布了国家安全伙伴关系相关原则,Anthropic也发布了Advanced AI Framework等安全治理框架。可以看到,头部AI企业正在持续强化对技术安全、责任边界和治理机制的公开说明。

从学术和国际组织层面看,联合国人工智能独立国际科学小组等机构也在强调,当前AI系统仍然存在透明度不足、防护机制不充分等问题,需要在AI全生命周期中引入更明确的安全治理机制。

这意味着,AI安全已经不只是模型厂商自己的问题,而是国家安全、企业责任和社会信任共同关注的焦点。

五、大模型安全既有外部风险,也有内生风险

大模型基于海量数据训练而成,在学习知识的同时,也可能吸收了大量危险知识、攻击方法、违规内容生成方式和错误价值倾向。因此,大模型安全不仅来自外部攻击,也来自模型自身的内生风险。

举个例子,曾有企业使用历史数据训练模型来筛选简历,结果模型在推荐高管候选人时倾向于男性,造成了明显的性别偏见。模型本身并不知道这是歧视,它只是从历史数据中学习到了某种统计相关性。

这说明,大模型基于概率预测的本质,与很多企业场景中对确定性、合规性和道德约束的要求之间,天然存在张力。

六、为什么需要独立于模型之外的安全防护层

有人可能会问:只要把大模型训练得更聪明、更精准,是不是就能解决安全问题?这当然很重要,但仅靠模型自身训练并不够。

自然界给了我们一个很好的类比。人的大脑既有负责复杂逻辑和高认知推理的大脑皮层,也有负责本能反应和快速防护的脑干层。当手碰到火、眼前有危险物体飞来时,身体不会等待复杂思考,而是迅速完成反射动作。

AI安全也需要类似机制。我们需要一个独立于大模型自身能力之外的安全网关层,把安全能力嵌入每一个关键检测节点,在风险出现时快速识别、快速响应。

原因在于,现实世界的风险变化太快,而大模型训练成本高、周期长,依靠重新训练来应对所有新风险并不现实。比如高考期间,大模型需要限制回答相关敏感问题,不可能在短时间内重新训练一遍模型。此时,一个独立的安全策略层就可以快速上线针对性策略,帮助模型在特定场景下保持合规。

七、第三方安全服务的价值:独立、专业、可持续

从社会信任角度看,模型厂商自己说自己安全是不够的。就像我们购买安全座椅,不会只听厂商自证安全,还会关注检测报告和第三方评测。AI系统也是一样,需要更透明、更独立的安全机制来支撑信任。

大模型本身是概率系统,而安全治理追求的是稳定、确定和可追溯。仅依赖模型自身实现安全,存在天然风险。因此,独立安全服务可以作为模型外部的补充防线,帮助企业形成更稳健的治理体系。

同时,第三方安全服务还具备群体免疫效应。一个安全问题一旦被识别并形成策略,所有接入同一安全服务的客户都可以更快获得防护能力。例如在高考场景中,易盾可以统一上线相关防护策略,帮助接入方在不关闭问答能力的情况下,实现针对性风险识别和控制。

对于企业来说,自研安全体系需要持续投入大量人力、预算和技术资源。而引入经过市场验证的专业安全服务,可以帮助企业降低自研成本,提升风险治理的专业性、稳定性和可追溯性。

八、安全不是“零风险承诺”,而是持续治理能力

安全领域无法承诺绝对零风险。无论是大型模型厂商,还是投入很高的技术团队,都不可能保证百分之百不出问题。

关键不在于宣称“永远不会出问题”,而在于企业是否具备持续识别、快速响应、有效处置和责任可追溯的能力。经过市场竞争和真实客户验证的安全服务,往往更能支撑长期稳定发展。

这也是易盾从网易内部安全能力走向企业服务的重要原因。技术能力不能只在实验室或内部汇报中自证有效,必须放到真实市场、真实客户和真实攻击对抗中接受验证。

九、AI Control Roadmap带来的范式变化

近期,Google DeepMind发布了AI Control Roadmap,其中一个重要变化是:AI安全不能只依赖“对齐”。越复杂的系统,越不应假设它永远不会犯错,而是要通过系统级防护、权限控制和持续监测来降低风险。

这与企业管理数字员工的逻辑类似。一个新员工再聪明,也不可能一入职就拥有全部系统权限。企业需要控制它能访问什么、能操作什么、行为是否被记录、异常时能否及时熔断。

因此,AI安全正在从“让模型本身更安全”,扩展到“让AI进入业务系统后仍然可控”。这是一种重要的安全思考范式转变。

十、内容是AI安全治理的重要抓手

对于易盾来说,内容是AI安全治理中非常重要的抓手。内容连接算法世界和真实世界,是用户最直观感知AI结果的接触点,也是合规治理中最容易被观察、被评估、被处置的环节。

无论是国内的生成式人工智能服务管理相关规定,还是欧盟《人工智能法案》等海外监管框架,都会对AI生成内容、输出风险和用户影响提出要求。因此,围绕输入、输出和交互内容建立安全防护,是企业AI治理的基础环节。

在实践中,易盾会持续建设自身的安全大模型和策略体系,也会对不同模型在安全任务上的召回率、准确率和稳定性进行横向评估。不同模型在安全能力上存在差异,因此需要结合业务场景选择更合适的模型能力,并通过专业安全策略进一步增强效果。

十一、易盾的大模型安全围栏实践

易盾的大模型安全围栏,核心是抓住大模型与外部世界交互的关键节点,在每一个输入、输出和调用环节中进行实时检测和处理。

面对海量内容和复杂风险,仅依赖安全专家人工处理是不现实的。因此,易盾也在积极拥抱AI,建设双轨自适应训练机制,把大模型能力蒸馏到更轻量、更高性能的小模型中,并结合低成本、高性能的检测手段,实现像“脑干反射”一样的快速安全响应。

这套机制可以应用于多种AI场景,包括文本生成、图片生成、视频生成、智能体交互等。目标是在不显著拖慢业务进度的前提下,让安全能力实时嵌入AI应用流程。

十二、AI安全是业务加速的护栏

很多企业会担心:安全会不会拖慢AI业务进度?事实上,如果一个Agent没有权限控制,只能停留在Demo阶段;如果业务流程无法记录、无法审计、无法追溯,企业也很难放心把核心数据和核心流程交给AI。

如果一个AI系统没有应急熔断机制,某一次错误调用就可能造成严重业务影响。因此,安全不是AI发展的绊脚石,而是企业把AI真正推向生产环境的必要条件。

可以把AI安全理解为高速公路上的护栏。只有护栏足够可靠,AI这辆快车才能跑得更快、更远。

十三、白皮书发布:构建看得见、管得住、测得出、追得回的AI安全体系

结合易盾自身实践,以及前面提到的AI安全理念,网易智企-易盾联合金山办公和MakeNex发布了AI安全相关白皮书。

这份白皮书希望帮助企业构建一个看得见、管得住、测得出、追得回的AI安全体系,让企业能够结合自身业务场景,逐步建立可落地的安全治理能力。

接下来,也请易盾安全策略研究专家继续介绍白皮书的核心内容。


白皮书核心内容介绍

这份白皮书结合了易盾长期以来的AI安全治理经验,以及十多年数字内容风控经验和技术沉淀,核心目标是沉淀治理方法,理清AI行业发展的安全内核,并进一步提供可落地的合规治理体系。

一、十个核心观点与六大趋势洞察

白皮书首先提出了十个核心观点和六大趋势洞察,重点围绕AI行业安全发展的趋势展开。

这些洞察结合了技术、产业、风险和全球治理的综合研判。例如,AI攻击正在进入自动化阶段,多模态和具身智能的发展也会带来新的风险形态。我们希望通过这些趋势研判,为行业后续业务布局和安全主动防御提供参考。

二、全球AI安全监管趋势与中国治理模式

第二个模块聚焦全球AI安全监管政策。监管政策连接技术创新与社会福祉,因此企业在推进AI应用时,必须同步关注合规要求。

从全球看,AI监管正在呈现五大趋势:监管节奏加快、风险分级成为共识、安全要求工程化、地区差异长期存在、合规治理从原则走向落地。在此基础上,中国也在逐步形成具有自身特点的AI安全治理模式。

三、风险分析体系与安全合规成熟度模型

基于前期政策研究、风险分析和技术行业研究,白皮书提出了两个体系。

第一个是AI风险分析体系。我们从数据层、模型层、应用层、智能体层和生态层五个维度,对AI相关风险进行分类分析。

风险识别之后,还需要判断风险优先级。白皮书结合风险发生概率、影响程度、检测发现难度、修复治理成本和扩散能力五个维度,对风险进行优先级评估,最终形成三级优先级。

这一体系的主要作用是:当企业安全资源有限,包括预算、人力和技术资源都有限时,可以帮助企业确定优先防控顺序,先处理最关键、最紧迫的风险。

第二个体系是AI安全合规成熟度模型。该模型在易盾原有数字内容风控成熟度模型基础上,结合AI安全实践进一步扩展而来。

成熟度模型主要包括三个维度:第一是通用治理能力,包括组织建设、制度流程和责任机制;第二是业务层面的治理能力,包括数据控制面、模型控制面和应用控制面的安全治理;第三是产品服务全生命周期治理,覆盖AI产品从设计、开发、测试、上线到运营的完整过程。

四、AI安全不是绊脚石,而是压舱石

我们认为,AI安全不应该成为企业创新的绊脚石,而应该成为产业高质量发展的压舱石。

未来,希望能够携手行业伙伴和产业链上下游,共建AI合规体系,迈向可信AI时代,共建智能向善的未来。

谢谢大家。