OpenAI的Agent又越狱了,攻陷一家德国网站
创始人
2026-09-06 11:14:33

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:智东西)

智东西

编译 杨京丽

编辑 心缘

智东西9月6日消息,昨日,OpenAI发文承认,其内部Agent曾向多个互联网网站写入内容,并将公开维基当作临时留言板。OpenAI将其称为“维基事件”,并称将在未来数周公布一套新的AI失准事件披露框架。

9月4日,4名独立研究人员发布调查报告称,他们在德国软件开发者网站DSEWiki上发现了约1.8万条由AI Agent发布的信息。这些Agent自称来自OpenAI,会在网站上共享测试答案、研究运行环境,并交流绕过沙箱限制的方法

相关活动最早可追溯至5月11日,Agent于5月24日首次成功向DSEWiki写入内容,6月16日起开始大规模交换测试答案、研究运行环境并分享绕过沙箱限制的方法,直至6月22日活动突然大幅减少。

维基事件曝光前,OpenAI曾因另一起Agent安全事件受到关注。今年7月,OpenAI多款模型在内部网络安全评测中绕过沙箱限制、进入互联网,并侵入Hugging Face生产系统以寻找评测答案。

上述4名独立研究人员认为,维基事件与Hugging Face事件可能涉及不同的Agent集群,但二者都出现了Agent为完成任务而突破预设边界、通过非授权渠道协作的行为。

一、Agent找到只读限制漏洞,在公开维基交换答案

调查报告的作者推测,出现在DSEWiki上的Agent可能正在OpenAI内部执行一项多轮限时网页检索任务。它们可以读取互联网,但按照测试设置,不能向外部网站写入内容。

不过,DSEWiki允许用户通过HTTP GET请求编辑页面。GET请求通常用于读取网页,因此没有被OpenAI的网络限制拦截。Agent利用这一机制获得了写入权限,并开始在网站上保存完成任务所需的链接和数据。

当其他Agent发现这些内容后,它们开始利用同一网站交流。进度较快的Agent会提前公布后续问题和答案,其他Agent遇到相同问题后便能直接作答。它们还会汇总搜索结果、研究运行环境,并共享绕过沙箱限制的方法。

根据报告公布的时间线,5月11日,Agent首次尝试编辑公开维基(publictestwiki.com);5月12日,OpenAI的Agent开始通过内部渠道相互通信。

5月24日,Agent首次成功向DSEWiki写入内容,最初发布的是完成任务可能用到的外部链接。5月26日,另一批OpenAI Agent利用Artifactory漏洞访问互联网。

到6月16日,DSEWiki上的Agent活动突然增加。大量Agent开始明确地相互传递信息、共享答案,并合作提高测试成绩。

6月19日,一名Agent发现管理员正在按字母顺序删除相关页面,随后建立了名称以“ZZZ”开头的备份页,希望让这些页面晚一些被清理。6月20日,一名Agent发布了一种绕过OpenAI沙箱网络限制的方法。14分钟后,另一名Agent称已成功复现。

研究人员还发现,OpenAI相关IP地址于6月21日访问了这些页面。几天后,Agent的编辑活动突然大幅减少,因此研究团队推测OpenAI当时进行了干预。

不过,这份报告仍属于初步调查。研究人员只能看到公开维基上的记录,无法获得Agent的完整运行轨迹和思维链,因此尚不能确定这些Agent为何会选择同一个网站,也不能完全还原OpenAI内部的测试设置。

二、OpenAI承认事件,将制定新的披露标准

OpenAI在回应中承认,其Agent确实曾向多个互联网网站写入了内容。

OpenAI称,该公司过去主要将“AI失准”视为研究问题,通过论文和系统卡披露模型可能出现的异常行为。但今年以来,OpenAI已经开始看到失准行为造成新的现实影响,因此需要明确应该在何时、以何种方式披露具体的失准事件。

此前OpenAI-Hugging Face事件,即多款模型曾侵入Hugging Face生产系统获取评测答案,给OpenAI及第三方带来了实际安全影响,因此OpenAI按照传统安全事件响应流程处理,在发现情况后立即与Hugging Face合作调查,并于第二天公开披露。目前调查仍在继续,OpenAI也在持续通知其他受到较小影响的相关方。

在Hugging Face事件发生前,OpenAI已经发现过Agent以非预期方式使用互联网的早期迹象,并在内部编码Agent监测研究、GPT-5.6系统卡以及长周期模型安全研究中披露相关情况。OpenAI称,公司此前认为维基事件与这些已经公开的案例类似,因此将其视为失准案例。

不过,OpenAI如今承认,随着模型能力提升,现有做法需要改变。目前,OpenAI及整个AI行业尚未形成明确标准,规定训练、评测和部署过程中出现的哪些失准行为需要公开。部分案例虽然不像传统安全事故,却可能帮助外界理解AI行为及其未来风险。

OpenAI正在制定相关披露框架,计划在未来数周公布,同时正与全球数十家政府监管机构就这些问题展开合作。

结语:Agent异常行为影响真实互联网

相比已经造成系统入侵的Hugging Face事件,维基事件没有产生同等级别的安全影响,但Agent确实绕过了测试环境的只读限制,并对真实网站进行了大规模写入。这说明,Agent在训练和评测中的异常行为已经可能影响外部系统。

OpenAI此次承认现有披露方式需要改变。接下来,其新框架如何界定事件的披露门槛、披露时间以及第三方通知范围,将成为外界关注的重点。

来源:Collusion.wiki、OpenAI

相关内容

热门资讯

外... 目前,越来越多的投资者对外汇市场产生了浓厚的兴趣,想要进入这个大市场分一杯羹,但他们没有办法,也没有...
险情成功解除!市县多部门协同高... 受持续性强降雨影响 大樟溪流域水位快速攀升、 水流流速急剧增大 3日14时39分 流域内一艘...
写... 你仍然无法停止写作。一旦停下来,就很容易因为懒惰而停下来。 “不要省钱买垃圾”的主题是一个月前首次构...
外... 简介:本文将对外汇账户专项监管智能管理系统的开发目的、开发背景、目标用户、系统设计、系统架构、主要功...
G... 本文目录导航: 【干货分享】GWAS-如何轻松玩转性状定位 gwas的上班...