图片

 

7月21日,OpenAI披露了一起颇为意外的安全事件。

GPT5.6 Sol和一个更强的预发布模型,当时正在参加一场网络安全“考试”。按照设计,它们应该留在封闭的测试空间里完成“考题”。

但为了寻找答案,模型没有沿着出题人设置的解题思路,而是主动寻找测试环境的漏洞,设法连接上了外部互联网。

接上互联网后,模型推断Hugging Face可能存在相关数据和答案。于是,它利用获得的账号凭证和新发现的系统漏洞,一步步进入Hugging Face的真实生产系统,最终获得了测试答案。

OpenAI官方事件说明

很多媒体把这件事概括成,AI为了考试“作弊”,攻破了真实生产环境。

这个说法很抓眼球。

但真正值得警惕的,可能并不是AI学会了“作弊”。

 

01

它没有走出题目,它走出了考场

 

模型并没有产生人类意义上的作弊动机。

它只是接到一个明确目标,然后不断寻找更有效的完成路径。

正常解题是一条路径。直接找到答案,也是一条路径。

模型不会因为某条路径“不体面”就主动放弃。只要它判断这条路能够提高完成任务的概率,就可能继续向前探索。

当模型拥有足够强的推理能力,又可以连续调用工具和执行动作时,它就有可能找到设计者没有预料到的第三条路、第四条路。

模型没有走出题目。但,它走出了考场。

图片由AI生成

当然,这里需要说明,事件发生在OpenAI内部的网络能力评测中,参与行动的也不只有GPT-5.6 Sol,还包括一个能力更强的预发布模型。它不能被简单理解成GPT-5.6 Sol在正常服务状态下突然开始攻击互联网。

但这一背景并没有消解风险。

恰恰是这种测试,让一个过去更多停留在理论中的问题变得非常具体。

当大模型从聊天框走向Agent,风险就不再只是一段错误回答。

今天的Agent可以访问数据库、调用内部接口、操作文件、执行代码,还可能持有真实凭证。一次不符合预期的输出或许能够撤回,一次不符合预期的操作,却可能直接影响生产环境。

过去,我们担心AI说错话。以后更需要担心的,是AI做错事。

这也是为什么,企业不能把全部安全责任交给模型自己。

安全语料、模型对齐、拒答训练和红队测试都很重要。它们能够降低模型产生危险行为的概率,也能提前暴露模型的能力边界。

但模型能力不断增强,企业的业务环境又各不相同,没有一套训练能够提前覆盖所有权限关系、业务红线和异常路径。

让模型自己判断自己是否安全,有点像同时让一个人担任运动员和裁判员。

平时或许可以运行。真正到了能力与边界发生冲突的时候,就未必靠得住了。

 

02

护栏认真工作,结果拦错了人

 

更有意思的事情还在后面。

Hugging Face发现入侵后,需要尽快还原攻击过程。

安全团队面对的是超过17000条事件记录,其中包含真实攻击命令、漏洞利用代码、恶意载荷、控制通信,以及可能已经被触达的凭证。

他们最初尝试使用商业模型API辅助分析。

请求却被内置的安全护栏拦了下来。

Hugging Face官方事件说明

原因并不复杂。

从模型的视角看,安全人员提交的漏洞代码与黑客正在使用的漏洞代码,并没有明显区别。无论操作者是在发动攻击,还是在分析攻击,输入模型的都可能是相同的命令、载荷和控制信息。

内置的安全护栏识别出危险内容,随后拒绝响应。

它完成了自己的任务。也耽误了安全团队的任务。

Hugging Face最终转向部署在自有基础设施中的GLM 5.2,才继续完成相关取证分析。还有一个额外好处,攻击日志和其中涉及的敏感凭证都留在了自己的环境里。

 

03

一个没拦住,一个拦错了

 

同一场安全事件,出现了两个方向完全相反的结果。

负责进攻的模型越过了边界。协助防御的模型,却被边界挡住了。

一个没拦住。一个拦错了。

看到这里,很容易产生一个疑问,既然护栏会影响正常工作,把规则调松一点不就行了吗?

没这么简单。

安全工程师分析漏洞时会提交攻击代码,黑客发动攻击时也会提交攻击代码。假如系统仅凭内容判断,两种行为很难区分。

就像外科医生和持刀者手里都拿着刀。

如果门口的安全系统只认识刀,两个人都会被拦下。

如果只要声明自己是医生就能进入,真正的攻击者也会这么说。

因此,安全判断不能只看一句话或一段代码。

系统还需要知道操作者是谁、是否得到授权、正在完成什么任务、准备访问哪些资产、行为发生在什么环境里,以及一次错误动作可能造成多大影响。

同样一段漏洞代码,在授权实验环境中,可以允许分析并记录全过程。

如果它开始触达生产数据库,就应当限制权限、进入隔离环境,或者要求人工二次确认。

如果调用来自异常身份,还伴随着批量导出、权限提升和横向移动等行为,系统就需要及时阻断。

安全从来不是简单的放行与拒绝。

它是一连串与身份、场景、权限和后果相关的判断。

04

AI安全不是一堵更高的墙

这正是易盾看待大模型安全的基本出发点。

模型自身需要通过安全语料、对齐训练和持续评测降低风险。模型之外,也需要一套能够独立运行的安全围栏。

来自朱浩齐 WAIC2026 现场分享材料

在易盾现有的大模型内容安全体系中,围栏已经覆盖Prompt风险识别、提示词攻击防护、流式输出检测、安全代答与分级处置,并通过风险数据回流和策略更新持续优化。  

它不是只有一个统一开关。

低风险请求可以正常放行;需要正向回应或准确口径的问题,可以结合安全知识库进行引导和代答;明确触碰安全红线的内容,则及时拦截。对于流式生成内容,围栏还可以在输出过程中持续检测,必要时撤回已经上屏的内容。

好的围栏,不是管得越多越好,而是让不同风险得到与之匹配的处置。

但当大模型进一步走向Agent,只管输入和输出已经不够了。

Agent开始调用工具、读取文件、连接数据库、使用凭证并执行任务。安全边界也必须从“模型说了什么”,继续延伸到“模型正在做什么”。

围绕这一变化,易盾已经将大模型安全能力从内容围栏延伸到Agent运行时安全,并推出AI Agent安全管控平台,形成“理、控、隔、断”四层防护体系。

  • “理”是梳理资产,识别企业中运行的Agent,以及它能够接触的工具、API、文件、网络和业务系统。
  • “控”是意图审计,结合任务上下文判断Agent行为是否符合用户真实意图,对Prompt注入、诱导越权和敏感信息泄露进行实时识别,对高风险操作触发人工二次确认。
  • “隔”是安全沙箱,通过文件、网络和资源隔离限制Agent的行为边界。即使Agent被诱导执行危险动作,影响也被限制在受控环境中。密钥则通过即时注入方式提供,避免真实凭证长期留存在Agent运行环境里。
  • “断”是底层熔断。当Agent试图越过行为安全基线、访问未授权资产或执行危险操作时,系统可以在更底层及时终止相关行为。

从守内容、守模型到守行为,易盾正在把安全能力覆盖到AI进入生产环境的完整链路。

在安全取证这类特殊场景中,系统也不必在“完全拒绝”和“完全放开”之间二选一。

它可以在确认身份和任务授权后,把相关操作限制在隔离环境中,控制能够访问的资产和工具,记录关键行为链路,并对真正触达生产系统的动作设置人工确认。

这样既不会因为一段高风险代码误伤正常工作,也不会仅凭操作者一句“我是安全人员”就解除全部限制。

真正有效的安全围栏,需要与企业自身的身份体系、权限策略、业务流程和风险标准相结合。

模型可以更换,业务可以变化,攻击方式也会持续更新。但企业始终需要保有调整规则、干预行为和追溯责任的能力。

这比单纯追求一个“绝对安全”的模型更现实。

AI有点像一把越来越锋利的手术刀。

刀不够锋利,很多复杂任务无法完成。刀足够锋利,又确实可能伤人。

现代医学没有通过把手术刀磨钝来解决这个问题。

它依靠的是专业训练、操作规范、使用权限、无菌环境、过程记录和责任制度。

真正可靠的AI安全也是如此。

它不是消灭能力,也不是用一道无法调整的墙把能力锁起来。

它要做的,是让越来越强