
7月21日,OpenAI披露了一起颇为意外的安全事件。
GPT5.6 Sol和一个更强的预发布模型,当时正在参加一场网络安全“考试”。按照设计,它们应该留在封闭的测试空间里完成“考题”。
但为了寻找答案,模型没有沿着出题人设置的解题思路,而是主动寻找测试环境的漏洞,设法连接上了外部互联网。
接上互联网后,模型推断Hugging Face可能存在相关数据和答案。于是,它利用获得的账号凭证和新发现的系统漏洞,一步步进入Hugging Face的真实生产系统,最终获得了测试答案。

OpenAI官方事件说明
很多媒体把这件事概括成,AI为了考试“作弊”,攻破了真实生产环境。
这个说法很抓眼球。
但真正值得警惕的,可能并不是AI学会了“作弊”。
它没有走出题目,它走出了考场
模型并没有产生人类意义上的作弊动机。
它只是接到一个明确目标,然后不断寻找更有效的完成路径。
正常解题是一条路径。直接找到答案,也是一条路径。
模型不会因为某条路径“不体面”就主动放弃。只要它判断这条路能够提高完成任务的概率,就可能继续向前探索。
当模型拥有足够强的推理能力,又可以连续调用工具和执行动作时,它就有可能找到设计者没有预料到的第三条路、第四条路。
模型没有走出题目。但,它走出了考场。

图片由AI生成
当然,这里需要说明,事件发生在OpenAI内部的网络能力评测中,参与行动的也不只有GPT-5.6 Sol,还包括一个能力更强的预发布模型。它不能被简单理解成GPT-5.6 Sol在正常服务状态下突然开始攻击互联网。
但这一背景并没有消解风险。
恰恰是这种测试,让一个过去更多停留在理论中的问题变得非常具体。
当大模型从聊天框走向Agent,风险就不再只是一段错误回答。
今天的Agent可以访问数据库、调用内部接口、操作文件、执行代码,还可能持有真实凭证。一次不符合预期的输出或许能够撤回,一次不符合预期的操作,却可能直接影响生产环境。
过去,我们担心AI说错话。以后更需要担心的,是AI做错事。
这也是为什么,企业不能把全部安全责任交给模型自己。
安全语料、模型对齐、拒答训练和红队测试都很重要。它们能够降低模型产生危险行为的概率,也能提前暴露模型的能力边界。
但模型能力不断增强,企业的业务环境又各不相同,没有一套训练能够提前覆盖所有权限关系、业务红线和异常路径。
让模型自己判断自己是否安全,有点像同时让一个人担任运动员和裁判员。
平时或许可以运行。真正到了能力与边界发生冲突的时候,就未必靠得住了。
护栏认真工作,结果拦错了人
更有意思的事情还在后面。
Hugging Face发现入侵后,需要尽快还原攻击过程。
安全团队面对的是超过17000条事件记录,其中包含真实攻击命令、漏洞利用代码、恶意载荷、控制通信,以及可能已经被触达的凭证。
他们最初尝试使用商业模型API辅助分析。
请求却被内置的安全护栏拦了下来。

Hugging Face官方事件说明
原因并不复杂。
从模型的视角看,安全人员提交的漏洞代码与黑客正在使用的漏洞代码,并没有明显区别。无论操作者是在发动攻击,还是在分析攻击,输入模型的都可能是相同的命令、载荷和控制信息。
内置的安全护栏识别出危险内容,随后拒绝响应。
它完成了自己的任务。也耽误了安全团队的任务。
Hugging Face最终转向部署在自有基础设施中的GLM 5.2,才继续完成相关取证分析。还有一个额外好处,攻击日志和其中涉及的敏感凭证都留在了自己的环境里。
一个没拦住,一个拦错了
同一场安全事件,出现了两个方向完全相反的结果。
负责进攻的模型越过了边界。协助防御的模型,却被边界挡住了。
一个没拦住。一个拦错了。
看到这里,很容易产生一个疑问,既然护栏会影响正常工作,把规则调松一点不就行了吗?
没这么简单。
安全工程师分析漏洞时会提交攻击代码,黑客发动攻击时也会提交攻击代码。假如系统仅凭内容判断,两种行为很难区分。
就像外科医生和持刀者手里都拿着刀。
如果门口的安全系统只认识刀,两个人都会被拦下。
如果只要声明自己是医生就能进入,真正的攻击者也会这么说。
因此,安全判断不能只看一句话或一段代码。
系统还需要知道操作者是谁、是否得到授权、正在完成什么任务、准备访问哪些资产、行为发生在什么环境里,以及一次错误动作可能造成多大影响。
同样一段漏洞代码,在授权实验环境中,可以允许分析并记录全过程。
如果它开始触达生产数据库,就应当限制权限、进入隔离环境,或者要求人工二次确认。
如果调用来自异常身份,还伴随着批量导出、权限提升和横向移动等行为,系统就需要及时阻断。
安全从来不是简单的放行与拒绝。
它是一连串与身份、场景、权限和后果相关的判断。
04
AI安全不是一堵更高的墙
这正是易盾看待大模型安全的基本出发点。
模型自身需要通过安全语料、对齐训练和持续评测降低风险。模型之外,也需要一套能够独立运行的安全围栏。

来自朱浩齐 WAIC2026 现场分享材料
在易盾现有的大模型内容安全体系中,围栏已经覆盖Prompt风险识别、提示词攻击防护、流式输出检测、安全代答与分级处置,并通过风险数据回流和策略更新持续优化。
它不是只有一个统一开关。
低风险请求可以正常放行;需要正向回应或准确口径的问题,可以结合安全知识库进行引导和代答;明确触碰安全红线的内容,则及时拦截。对于流式生成内容,围栏还可以在输出过程中持续检测,必要时撤回已经上屏的内容。
好的围栏,不是管得越多越好,而是让不同风险得到与之匹配的处置。
但当大模型进一步走向Agent,只管输入和输出已经不够了。
Agent开始调用工具、读取文件、连接数据库、使用凭证并执行任务。安全边界也必须从“模型说了什么”,继续延伸到“模型正在做什么”。
围绕这一变化,易盾已经将大模型安全能力从内容围栏延伸到Agent运行时安全,并推出AI Agent安全管控平台,形成“理、控、隔、断”四层防护体系。

-
“理”是梳理资产,识别企业中运行的Agent,以及它能够接触的工具、API、文件、网络和业务系统。 -
“控”是意图审计,结合任务上下文判断Agent行为是否符合用户真实意图,对Prompt注入、诱导越权和敏感信息泄露进行实时识别,对高风险操作触发人工二次确认。 -
“隔”是安全沙箱,通过文件、网络和资源隔离限制Agent的行为边界。即使Agent被诱导执行危险动作,影响也被限制在受控环境中。密钥则通过即时注入方式提供,避免真实凭证长期留存在Agent运行环境里。 -
“断”是底层熔断。当Agent试图越过行为安全基线、访问未授权资产或执行危险操作时,系统可以在更底层及时终止相关行为。
从守内容、守模型到守行为,易盾正在把安全能力覆盖到AI进入生产环境的完整链路。
在安全取证这类特殊场景中,系统也不必在“完全拒绝”和“完全放开”之间二选一。
它可以在确认身份和任务授权后,把相关操作限制在隔离环境中,控制能够访问的资产和工具,记录关键行为链路,并对真正触达生产系统的动作设置人工确认。
这样既不会因为一段高风险代码误伤正常工作,也不会仅凭操作者一句“我是安全人员”就解除全部限制。
真正有效的安全围栏,需要与企业自身的身份体系、权限策略、业务流程和风险标准相结合。
模型可以更换,业务可以变化,攻击方式也会持续更新。但企业始终需要保有调整规则、干预行为和追溯责任的能力。
这比单纯追求一个“绝对安全”的模型更现实。
AI有点像一把越来越锋利的手术刀。
刀不够锋利,很多复杂任务无法完成。刀足够锋利,又确实可能伤人。
现代医学没有通过把手术刀磨钝来解决这个问题。
它依靠的是专业训练、操作规范、使用权限、无菌环境、过程记录和责任制度。
真正可靠的AI安全也是如此。
它不是消灭能力,也不是用一道无法调整的墙把能力锁起来。
它要做的,是让越来越强
IM即时通讯
实时对话智能体
智能硬件开发套件
音视频通话
短信
信令
直播
点播
互动白板
七鱼AI客服
客服类Agent
在线客服
科学策略中心
智能外呼
营销类Agent
问卷调研
文本检测
图片检测
音频检测
视频检测
智能审核平台
风控引擎
行为式验证码
实名核验
人脸核验
隐私合规检测
网易知数
有数BI
大数据基础平台
数据开发治理平台
指标平台
数据中台
研发智能化
智能页面生成
平台私有化定制
企业级RAG知识库
自主智能体
智能协作中枢
AI应用搭建
游戏行业
全生命周期解决方案
游戏安全解决方案
游戏AI智能体
娱乐社交
多人语音聊天室
游戏语音
娱乐社交出海
社交场景反欺诈
内容安全合规
大型直播活动
AI应用
AI应用开发
医疗行业
区域医疗
智慧医院
药店运营
教育行业
在线教育
绿色清朗课堂
课后服务
金融行业
泛金融
全链路数据风控
运营增长
存量用户促活
营销留资转化
企微客服
企微导流

