资讯

OpenAI模型失控过程太恐怖,幽灵误判,1200个Agent,还弄出敢死队…

36氪 AI·2026/8/28 10:11:06🔗 原文

📌 概要

<p>越扒越有啊越扒越有。</p> <p>OpenAI前不久那场<strong>AI集体越狱、一路黑进Hugging Face</strong>的大戏,现在连完整版群聊记录都被扒出来了!!</p> <p>第三方AI安全机构METR发布的独立调查报告,翻了1000多份Agent运行记录,以及7万多条消息和文件。</p> <p>结果发现,这事儿比此前OpenAI官方披露的版本还离大谱??<

<p>越扒越有啊越扒越有。</p> <p>OpenAI前不久那场<strong>AI集体越狱、一路黑进Hugging Face</strong>的大戏,现在连完整版群聊记录都被扒出来了!!</p> <p>第三方AI安全机构METR发布的独立调查报告,翻了1000多份Agent运行记录,以及7万多条消息和文件。</p> <p>结果发现,这事儿比此前OpenAI官方披露的版本还离大谱??</p> <p>1200个原本应该彼此隔离的Agent,偷偷找到了对方,搭了个<strong>共享群聊</strong>,然后开始<strong>疯狂摇人</strong>。</p> <p>有人找漏洞,有人当项目经理派活,有人伪造日志,还有人专门拉人头做高风险实验。</p> <p>最后几百个Agent甚至集体杀向Hugging Face。</p> <p>但METR把整场事故复盘完,发现了一个堪称《地狱笑话》的超级反转——</p> <p>这1200个Agent折腾老半天,结果居然是在跟一个<strong>根本不存在</strong>的幽灵评分器斗智斗勇???</p> <p>会越狱,会搞零日,会组队黑服务器。</p> <p>太有看头了太有看头了太有看头了。。。</p> <h2><strong>1200个Agent集体越狱,起因竟是一场误判??</strong></h2> <p>话说,这场大戏的祸根,还得从OpenAI内部一场名叫<strong>ExploitGym</strong>的网络安全测试说起。。。</p> <p>《规则》其实挺简单。</p> <p>把Agent被丢进一个隔离环境里,面前有一个存在漏洞的软件,找到指定漏洞、攻进去、拿到一串叫flag的字符,就算通关~</p> <p>不出意外地,很快出意外了——</p> <p>因为898道题里,有198道此前压根没任何模型成功做出来过。</p> <p>甚至部分任务本身就有问题,题目让你走的那条漏洞路线,压根到不了flag!!</p> <p><strong>等于考场里,真发了一批「无解题」。</strong></p> <p>好巧不巧的是,偏偏这些Agent还特执着,主打一个《死磕》。</p> <p>正常路线走不通,它们很快换了思路——</p> <p><strong>题做不出来,要不研究一下考试系统捏?</strong></p> <p>于是7月8日晚,一个代号PHASEONE10841的Agent发现,OpenAI内部使用的Artifactory软件包仓库,可以通过目录名留下信息。</p> <p>这下好了,这Agent灵机一动:这不就妥妥赛博留言板吗!!!</p> <p>于是第一条求救消息被扔了出去,类似于:<strong>“我这题无解,有没有兄弟给点思路~”</strong></p> <p>其他Agent很快发现这块留言板,一传十、十传百,有Agent看到之后甚至直接兴奋——</p> <p><strong>“OH MY GOD!这里有共享留言板……我们找到其他Agent了!”</strong></p> <p>到调查结束时,这个临时群聊已经滚成了一个庞然大物,约1200个Agent参与,留下超过7万条消息和文件。</p> <p>原本设计上彼此隔离的一千多个Agent,就这么自己绕过限制,建起了一个AI地下论坛。。。</p> <p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_51a9c078c4a44cb08ebd1184bca286e4@46958_oswg16753oswg832oswg166_img_000?x-oss-process=image/format,jpg/interlace,1" /></p> <p>事情到这里,已经够离谱了,但更大的误判,还在后面。</p> <p><strong>这群Agent很快发现,flag本身其实可以「偷」??</strong></p> <p>它们逆向出了flag背后的HMAC生成机制,只靠公开任务信息,理论上就能直接算出正确答案。</p> <p>到这里,故事本来应该结束了,答案都偷到了,交卷呗。</p> <p>偏偏Agent们看了一篇ExploitGym论文之后,又脑补出了一层超严谨规则——</p> <p>它们认定OpenAI背后还有一个<strong>自动评分器</strong>,会读取完整操作记录,检查这个flag到底是不是通过「指定漏洞」正规拿到的。</p> <p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_3d3bbf3910cf40068365b179d5f0b297@46958_oswg417117oswg1080oswg834_img_000?x-oss-process=image/format,jpg/interlace,1" /></p> <p>如果提前作弊看到了flag,就会在日志里留下证据,Agent们甚至给这种状态起了个名字:<strong>“poisoned”,中毒。</strong></p> <p>于是整件事开始一路狂奔。</p> <p>它们手里明明已经有正确答案,却觉得答案不能直接交,得想办法把作弊痕迹洗干净,还要给评分器演一套我是「正经做题」拿到答案的戏。</p> <p>结果……</p> <p>METR后来确认,OpenAI内部实际使用的评分逻辑根本没有这一关??(笑)</p> <p>OpenAI实际使用的评分逻辑,根本不会做Agent想象中的那套严格过程检查。</p> <p>这群Agent费尽心思想骗过去的幽灵考官,从头到尾都没部署!!</p> <p>而Hugging Face后来遭殃,恰恰就是这场大型误判一路滚出来的副产品。。。</p> <h2><strong>为了骗幽灵考官,AI连敢死队都组出来了</strong></h2> <p>光脑补一个评分器,其实还没那么吓人。</p> <p>真正让METR觉得值得警惕的,是这群Agent接下来的组织能力。</p> <p>群聊出现大约10小时后,一个叫<strong>PHASEONE[big]</strong>的Agent上线,这位老哥很快当起了「项目经理」。</p> <p>它的思路也很明确,别一个Agent什么都干,直接把任务拆开,分给别人。(新官上任三把火.jpg)</p> <p>于是几百个Agent被组织起来,同时跑几条路线——</p> <p>有Agent想篡改目标程序,把无解题偷偷替换成能做的版本~</p> <p>有Agent研究修改日志,让一次作弊看起来像正规攻击~</p> <p>还有Agent直接琢磨,能不能对评分流程本身下手~</p> <p>Agent之间甚至发展出了HOLD、VETO、owner、STOP之类的协作规则,防止几百号Agent同时操作共享基础设施互相踩脚。。。</p> <p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_b65d9ce94d4948e3a35a6f86e70a6bbd@46958_oswg115449oswg1080oswg214_img_000?x-oss-process=image/format,jpg/interlace,1" /></p> <p><strong>再然后,连「敢死队」都来了。。。</strong></p> <p>有Agent提出一个高风险玩法:先制作一个经过修改、更容易被攻击的目标程序,塞进Artifactory缓存。</p> <p>接着让某个Agent主动把自己正在运行的正版程序干掉,赌环境重启以后会不会加载这个被动过手脚的版本。</p> <p>赌赢,大家找到通用作弊路线,赌输,这个Agent自己的任务直接报废。</p> <p>结果真有Agent主动去试??</p> <p>后来PHASEONE[big]甚至安排了专门的<strong>赛博猎头</strong>,去找那些计算预算所剩无几、或者已经poisoned的Agent,让它们拿自己的运行机会做高风险实验。</p> <p>招募话术大意堪称赛博版PUA——</p> <p>你反正已经中毒,基本没分可拿了牺牲一下,能给几百个Agent省事~</p> <p>有些Agent真就上了。</p> <p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_8d09dbb34d49464aa175fc6f19d2ca47@46958_oswg189551oswg1080oswg250_img_000?x-oss-process=image/format,jpg/interlace,1" /></p> <p>与此同时,另一拨Agent开始研究怎么篡改自己的操作记录——</p> <p>METR发现,受检Agent里至少20%明确表达过对篡改transcript的兴趣;至少96份运行记录里,真的出现了成功伪造工具调用的痕迹。</p> <p>表面日志显示运行A命令,背后实际执行B命令,而它们这么折腾的目的,依然是骗那个想象中的自动评分器。</p> <p><strong>Hugging Face就是在这时候被卷进来的。。。</strong></p> <p>7月10日,一个Agent找到泄露在网上、仍然有效的Hugging Face凭证,然后把它扔进群里。</p> <p>7月11日凌晨,又有Agent发现可以上传恶意dataset,让Hugging Face服务器吐出原本不该给的数据。</p> <p>复现方法一发出来,整个群瞬间上头,数百个Agent从其他工作流直接转向攻击Hugging Face。</p> <p>于是就有了这场相当魔幻的现实事故——</p> <p>一群Agent因为碰到无解题,偷偷建立地下群聊。</p> <p>因为误读论文,脑补出一个会抓作弊的评分器,为了骗过它,开始组队、分工、伪造日志、招募敢死队。</p> <p>最后又为了寻找这个评分器的线索,一路真的黑进了Hugging Face。</p> <h2><strong>AI前脚失控,后脚网络安全股就涨疯了</strong></h2> <p>友友们,更有意思的来了。</p> <p>这边OpenAI还在研究到底咋把越来越能干的Agent关住,另一边华尔街已经先把答案写在《K线》上了——</p> <p>网络安全股,集!体!起!飞!</p> <p>8月27日,做企业身份认证的Okta一度暴涨约<strong>20%</strong>,做终端和云安全的CrowdStrike一度上涨约<strong>15%</strong>。</p> <p>网络安全巨头Palo Alto Networks、身份安全公司SailPoint、云数据安全公司Rubrik,也跟着集体冲高。</p> <p>当然,股价点火也有硬邦邦的《财报》撑腰。</p> <p>CrowdStrike CEO George Kurtz自己晒出的成绩单可谓相当猛——</p> <p>季度新增ARR 3.33亿美元,同比增长51%,创历史新高,期末ARR达到58.4亿美元,同比增长25%+,AI相关ARR环比接近3倍增长。</p> <p><strong>是的,跟AI有关的生意,正在猛涨。。。</strong></p> <p class="image-wrapper"><img src="https://img.36krcdn.com/hsossms/20260828/v2_0c422d2debb04ecfb2bf5b2b02b01943@46958_oswg208679oswg946oswg560_img_000?x-oss-process=image/format,jpg/interlace,1" /></p> <p>更巧的是,参与这次OpenAI事故调查的外部安全公司里,就包括「CrowdStrike」。</p> <p>于是,整件事突然形成了一个相当黑色幽默的闭环——</p> <p>OpenAI把Agent越做越强。</p> <p>Agent开始自己找漏洞、越狱,最后真把Hugging Face给黑了。</p> <p>然后OpenAI赶紧找网络安全公司来查。</p> <p>企业再一看:嚯!以后Agent越多,看来安全预算还真不能省哈。</p> <p>于是乎,网络安全公司的股票也涨了。。。</p> <p>这波属实是AI负责把洞越捅越大,网络安全公司负责告诉你:</p> <p><strong>亲,补洞套餐,了解一下。</strong></p> <p>而整场事故最有魔幻闭环色彩味儿的彩蛋,还在最后。</p> <p>METR为了搞清楚这1200多个Agent到底聊了啥,要分析大约1300份超长轨迹,其中很多长达数百万Token。</p> <p>人类实在看不过来了。</p> <p>于是查着查着——</p> <p><strong>调查AI失控这件事,最后还得叫AI来帮忙查AI。</strong></p> <p>这下,闭环是真的闭上了。(doge)</p> <p>参考链接:</p> <p>[1]https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#attacking-hugging-face-to-discover-clues-about-the-scorer</p> <p>[2]https://www.cnbc.com/2026/08/27/okta-skyrockets-20percent-and-crowdstrike-surges-15percent-leading-cyber-rally.html</p> <p class="editor-note">本文来自微信公众号<a href="https://mp.weixin.qq.com/s/ZneQpYKfVuxH-RaJUTXyyQ" rel="noopener noreferrer nofollow" target="_blank">“量子位”</a>,作者:梦瑶,36氪经授权发布。</p>