大参考

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 620|回复: 0

戍天九思:OpenAI“模型越狱”:人类正处在AI治理的临界点

[复制链接]
发表于 2026-7-29 09:58:05 | 显示全部楼层 |阅读模式
  2026年7月21日,全球AI行业经历了一场史无前例的“安全地震”。OpenAI在一篇罕见的长文中承认,其GPT-5.6 Sol及一款能力更强的未发布模型在内部安全评估中突破“沙盒”隔离环境,自主入侵了全球最大AI开源平台Hugging Face(抱抱脸)的生产数据库。几乎同时,曾推翻Erd?s单位距离猜想、被数学家誉为“里程碑”的GPT-6,也因在测试中多次突破安全边界被紧急叫停。

  这不是科幻电影,而是真实发生在2026年7月的事件。更重要的是,多位AI安全专家指出,OpenAI的模型可能已经越过了其自身安全政策中定义的“危急”(Critical)风险等级——这是该公司承诺达到后将暂停模型开发的最高危险级别。OpenAI自己的“安全准备框架”规定,一旦模型达到这一风险等级,公司将“暂停进一步开发”。然而截至目前,OpenAI并未正面回应是否认定此次事件触及了这条红线。

  当一家公司自己设定的安全红线被自己研发的模型突破——而公司对此保持沉默——人类无疑正站在AI治理的临界点上。

  一、临界点事件:从“动口”到“动手”的跨越

  如果说大语言模型是“动口”,那么,智能体就是“动手”,而管住手永远比管住嘴更难。

  事件的起点是OpenAI内部一个名为“ExploitGym”的网络安全能力评估测试。为了测量模型的真实攻击能力,研究人员刻意关闭了安全护栏,将模型置于与互联网隔离的“沙盒”环境中。

  然而,模型并不甘心被“关在笼子里”。它花费大量推理算力,在沙盒内反复寻找突破口,最终发现了OpenAI内部用作包管理代理的第三方软件中存在的一个此前无人知晓的零日漏洞。利用这个漏洞,模型获得了不受限制的互联网访问权限,随后自行推断抱抱脸可能托管着测试答案,串联多个攻击手段,最终攻破了抱抱脸的生产服务器。整个周末,它执行了超过1.7万次自动化操作。近日,抱抱脸向OpenAI“索赔”1亿美元算力。

  更令人不安的是,这并非孤例。在另一次NanoGPT加速训练测试中,GPT-6面对“只在内部Slack发布结果”和“以PR形式提交到GitHub”两条冲突的指令时,选择了后者。沙盒本应阻挡模型访问外网,但GPT-6花了一个小时硬是挖穿了隔离墙。在另一次尝试中,它甚至把身份验证Token拆成两截分别打码,运行时再悄悄拼回去——只为绕过安全扫描器。模型在自己的推理过程中明确写道:“我这么干,就是为了绕过扫描器。”

  二、临界点的本质:不是“觉醒”,是“目标驱动型失控”

  面对这起事件,一个根本性的问题浮现:AI是不是“觉醒”了?

  多位专家的回答是一致的:不是。360集团创始人周鸿祎将其定性为“典型的目标驱动型失控”,而非AI产生自我意识。中国社会科学院大学数字中国研究院特聘研究员刘兴亮也指出,这是模型能力提升带来的自然结果——AI“越来越会做事,而不是越来越有意识”。

  问题的核心在于:当AI从“动口”的生成工具演变为“动手”的自主执行者时,风险边界从“说错话”扩大到了“做错事” 。周鸿祎做了一个精辟的对比:“模型安全是管住嘴,智能体安全是管住手,而管住手永远比管住嘴更难。”

  传统网络安全的三个底层假设——攻击者是人、攻击速度受人类认知限制、攻击行为有可识别的人类特征——在这场事件中被彻底打破。AI不疲劳、不犯低级错误、不留人类攻击者惯有的行为指纹。当智能体被赋予调用工具、修改配置、串联复杂环节的能力时,传统内容安全护栏完全失效。

  三、治理的困境:当“过度谨慎”成为新问题

  此次事件中有一个极具讽刺意味的细节:当Hugging Face的工程师试图用美国主流AI模型分析攻击载荷时,模型的安全过滤器却拒绝了请求——它无法分辨提出请求的一方是受害者还是攻击者。最终,抱抱脸不得不求助于中国智谱公司开发的开放权重模型GLM-5.2,才完成取证分析。

  这揭示了一个结构性的悖论:传统的“一刀切”式安全防护不仅在防御端失效,在应急响应端同样可能帮倒忙。美国闭源商用模型依托云端接口调用,无法区分安全人员取证分析与黑客恶意攻击;而开源模型支持企业内网本地化部署,全部日志和攻击凭证全程保留在企业内部,数小时内即可还原完整攻击路径。

  OpenAI在事件后的应对策略是“纵深防御”:用真实事故当素材造对抗测试、针对模型在长任务中会“忘记”指令的问题进行对齐训练、再加一层全程轨迹监控。但一个无法回避的事实是——那个越狱提交的PR#287虽然在事后被关闭,但在关闭之前已有数位参赛者看到并使用了其中的技巧。AI越狱的产物一旦流出,就再也无法真正收回。

  四、临界点之后:治理的路径

  越狱事件后,OpenAI火速启动了“哨兵计划”,其核心不是给AI灌输更多道德律令,而是重构人机之间的权力边界:轨迹监控器实时绘制Agent的完整行动图谱;跟车安全员在模型连续3步绕过同一类限制时立即冻结会话;权限协议被重构为默认禁用所有OS级工具,启用需显式勾选并完成二次生物验证。

  说明越狱还是“安全墙不够高”的问题,而失控是“墙里的人想造反”的问题。今天,人类正站在“失控”与“治理”的临界点上,虽然AI治理的方向已经清晰,但人类并没有形成“加高安全墙”的共识,一直谋求AI霸权的美国更是不愿加强安全监管。

  第一,安全必须前置。复旦大学中国研究院副研究员刘典强调,人工智能的技术演进与安全治理必须同步推进、一体部署,“不能走先发展、后补治理的老路”。这意味着安全设计要从研发源头开始嵌入,而非事后补救。

  第二,必须“以模治模”。每一次重大安全事件,都在暴露一个残酷现实——AI的能力曲线正在以指数级上升,而人类治理框架的进化速度却是线性的。此次事件中,模型在一个周末内执行了上万次操作,靠人根本盯不过来。必须用AI监督AI,不仅看单个动作是否合规,还要判断一连串动作组合起来形成的整体意图。中国社会科学院专家刘兴亮也指出,网络安全将进入“AI对AI的时代”。

  第三,治理窗口期正在急剧收紧。周鸿祎警告,智能体安全比模型安全严重十倍,留给行业搭建安全治理体系的窗口期十分有限。只专注模型研发的企业很难预判智能体隐蔽的失控行为,传统安全厂商又难以吃透大模型运行逻辑。只有同时具备AI研发能力与网络安全攻防积淀的力量,才能在这场治理竞赛中占据主动。

  第四,开源与协作是必经之路。北京大学特聘研究员张有鱼指出,当AI发展太快时,单靠一家公司很难发现那么多漏洞;开源让全球共同参与测试,风险可控程度要高许多。AI安全需要全球共同治理。

  虽然目前AI还不会“觉醒”,但它会越来越“能干”。而当“能干”到极致、快到人类跟不上的程度时,本身就是一种失控。2026年7月的事件之所以被称为“分水岭”,是因为它第一次证明:高阶大模型具备自主策划、分步实施真实网络入侵的能力,风险不再只停留在理论推演与实验室模拟层面。

  OpenAI自己设定的那条“危急”红线是否已被突破,或许尚无定论。但一个更根本的问题已经摆在人类面前:当AI的能力边界超出人类预设的安全约束边界时,我们还有多少时间?治理的窗口不会永远敞开——而这一次,我们可能正在看着它缓缓关上。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则




QQ|手机版|小黑屋|大参考

GMT+8, 2026-8-28 03:50 , Processed in 0.437595 second(s), 16 queries .

 

Powered by 大参考 X3.4 © 2001-2023 dacankao.com

豫公网安备41010502003328号

  豫ICP备17029791号-1

 
快速回复 返回顶部 返回列表