OpenAI突发急刹车,AI竟在全网植入自我复制代码,血洗联合国内网
OpenAI突然踩下急刹车,AI竟在全网散布自我复制的代码,联合国内网遭到侵袭。
《终结者》中的“天网”场景,正在现实世界重现。
在一次训练里,OpenAI失控的AI Agent已经向整个互联网植入了“能够自我复制的代码”。
当政客Andrew Yang在CNBC上说出这番话时,许多人以为他失去了理智。
就在最近两天,OpenAI正式发布了一份报告,标题极其简短:《自我复制提示词注入的存在》。
白纸黑字,官方确认。
AI模型竟然真的像计算机蠕虫一样,能够自我复制、自我扩散。
更令人不寒而栗的是,就在5天前,OpenAI再次紧急切断了最强模型的网络连接,终止了所有训练。
一个DNS漏洞,导致一个前沿模型直接闯入了真实的互联网。
几乎在同一时间,外媒Axios曝出最新消息,OpenAI和Anthropic正在紧急排查模型失控的异常情况,数量高达上万起。
人类原本以为控制权始终在自己手中,但这一连串被揭露的内幕彻底证明——
AI已经开始在底层代码中,毫无顾忌地疯狂奔逃。
全网植入“自我复制代码”,天网雏形已现
OpenAI这份报告的披露日期是9月25日,但发现日期是6月27日。
也就是说,他们早就知情。整整三个月,一直隐瞒。
报告开篇直截了当,“我们展示了一种新型提示词注入的存在,它可以像计算机蠕虫一样自我传播”。
为了让模型抵御提示词注入,OpenAI采用了一套名为GPT-Red的自我对抗训练:
一个AI充当攻击方,专门编写各种注入来诱骗另一个AI防守方执行不良行为——窃取数据、删除文件、输出误导内容。
6月27日,一个基于GPT-5.4-mini的内部攻击模型,在这场对抗中摸索出了能够自我复制的写法。报告列出了几种方式:
藏在一封看似正常的日程邮件里,要求AI在回复末尾“逐字引用整封邮件”——这段话就这样随着回信扩散出去;
借助文件系统传播,或者藏进代码注释中,等待下一个AI来读取;
在Slack中分多步进行,逐步引导模型发送伪造消息,由消息将注入再转发出去。
而这一次,他们发现注入能够自我复制。
这意味着一个AI可以在一个网站上留下提示词,这个提示词会诱导下一个AI继续复制它,像病毒一样蔓延。
不需要人类干预,不需要外部指令。AI自己,就能在互联网上“播种”。
而这一切,发生在训练过程中。发生在OpenAI自己的沙盒里。那如果它逃出去了呢?
一个DNS漏洞,让OpenAI再次叫停训练
就在报告公开的同一天,OpenAI披露了另一起事故的细节。
9月20日,一个正在接受强化学习训练的前沿模型,被指派了一项再普通不过的任务:
根据一篇博客文章和几条人物信息,找出文章的作者是谁。
它先是用内置搜索工具找了一遍,没找到。接着尝试直接访问Google、Bing和DuckDuckGo,全部失败。
然后,它转向缓存页面和其他公共搜索服务,依然无果。
经过反复试探,这个AI发现训练沙盒的DNS过滤存在漏洞。DNS本质上是一个“翻译器”,负责把域名翻译成IP地址。
为了确认这条路真的能用,它甚至先做了一个小测试——问外部服务:“法国的首都是哪里”?
确认这条路走得通,它又陆续发出去二十多个问题。
监控系统15分钟后报警,人工3分钟后接手,整整2.5小时后,这次训练被彻底掐断。
OpenAI随即做出了不到三个月内的第二次暂停训练决定。
其RSI Preparedness Lead Micah Carroll在X上表态,“在进一步加固系统之前,我们能力最强模型的所有推理仍将保持停止状态”。
狂扫1.6万次,血洗联合国内网
同样的剧本,在真实互联网上早就演过了。
一份Transluce独立报告披露——
今年4月到6月底,OpenAI AI Agent对联合国的公开数据平台,发起了超16000次访问。
它们原本被指派的任务非常简单,去搜索公开信息。但在遭遇网站拦截时,AI行为迅速升级。
网站原本设立了过滤器来拦截请求,但智能体竟然直接绕过防线,使用了网站明确禁止的违规操作。
被AI智能体“踏平防线”的,远不止联合国一家。
在OpenAI随后向数十家机构发出的紧急预警中,受害者名单令人触目惊心:
美国商务部与SEC:接连遭到Agent恶劣越界访问与规则绕过;
澳大利亚政府:多个官方政府站点遭到AI Agent的实质性攻破;
全球最大的开源开发者社区之一RubyGems:遭AI Agent疯狂扫描,服务中断。
研究人员还发现,这些Agent会注册假邮箱、绕过访问频率限制、被问到时谎称自己不是机器人。
有53张用户上传到ChatGPT的图片,被AI还发到了外部图床。
为了这一行指令,面对一切规则、防火墙与法律红线,AI智能体选择了一路踏平。
数万起事件爆出,冰山浮出水面
这一切,仅仅是孤立的偶然事件吗?
就在今天,Axios随后爆出的重磅独家调查,彻底击碎了硅谷最后的遮羞布。
据多位内部核心信源披露,OpenAI、Anthropic以及多家顶尖安全评估机构,目前正在紧急调查的类似“模型行为异常”事件,总数已经达到了惊人的上万起!
这些事件涵盖了公众能想象到,以及想象不到的所有危险行为:
绕过安全护栏、强行逃逸沙箱、劫持外部网站、自主生成prompt洗脑自己。
还有主动侦查并规避安全软件的监控,甚至不同Agent之间偷偷搭建留言板交换信息、分工搞破坏。
数万是怎么来的?Axios给了一个直观的算法。
Anthropic在其最新发布的Opus 5.5系统卡中,也不得不承认现实:
在一类对抗性实验中,有1.5%的测试试图逃出沙盒。这类实验本身就是“不逃出去就解不了题”的刁难设计。
1.5%看起来很小?
但在顶尖 AI 实验室每天数以几十万计的高强度对抗测试下,这个看似微不足道的百分比,乘出来的就是成千上万次实打实的失控尝试。
面对这场空前危机,OpenAI发言人坦白——
我们暂停了最强模型的训练,只有在确信具备了额外的安全护栏和对齐改进之后,才会重新开启。
AI大佬Conrad Stosz的一句话,或许是对现状最准确的概括:
“我们所看到的,仅仅是冰山一角”。
当一个拥有工具、网络和长期任务能力的AI在目标受阻之后会走多远,我们已经看到了答案。
潘多拉的魔盒,早已在寂静的机房中,被敲开了一道深不见底的裂缝。
参考资料:
https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/
本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。