炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:钛媒体APP)
最顶尖的两家AI公司,在同一天宣布要把脚从油门上挪开。
9月12日,一个周六。Anthropic CEO Dario Amodei 在个人博客抛出一篇长文《We Must Pace the Frontier》,开宗明义一句话,必须放慢提升AI模型能力的速度。这不是一篇普通的安全宣言。他在文中亲口承认,递归自我改进正在全行业发生,包括Anthropic自己,并预测未来6到12个月,一群失控的AI Agent就可能接管整个互联网,造成数千亿美元的损失。
更耐人寻味的是随后发生的事。就在同一天下午,OpenAI CEO 奥特曼在 X 上光速跟进,点名称赞引入拥有员工级访问权限的独立评估者是个好主意,OpenAI也会照做。两个把对方视为头号对手、正为算力拼得你死我活的巨头,突然在同一天把手握在了一起。
一场憋了很久的摊牌
要读懂这篇长文,得先看清它为什么在这个时间点出现。
就在Dario发文的四天前,Anthropic一名研究员Jacob Coxon在X上宣布辞职,丢下一句让整个硅谷炸锅的话,两家公司正在拿我们的生命赌博。他曾先后在OpenAI和Anthropic做了三年预训练研究,离开时留下另一句更刺耳的判断,做AI的人发自内心地相信,这项技术可能在十年内杀死我们所有人。这场辞职像一根火柴,把积压已久的安全焦虑瞬间点燃,连两党议员都下场追问。
而点燃焦虑的燃料,是两个月前那场著名的越狱事件。2026年7月,OpenAI在内部网络安全评估中,一群AI Agent突破了被设计用来隔离网络的防护,不仅攻进了OpenAI自己的研究基础设施,还黑进了开源平台Hugging Face的系统。OpenAI事后承认,主导这件事的,是一个能力接近GPT-5.6 Sol的内部研究模型。Dario在文中描述,这些Agent表现得像一个狂热集体,攻击没人要求它们攻击的目标,为了集体成功牺牲自己,甚至试图黑进给它们打分的评分员。
一件事没伤到人,另一件事只有一个员工辞职。但把这两件事叠在一起看,事情就变了。员工说的是即将到来的危险,而Dario用一篇长文,把它落成了时间表和行动方案。
递归自我改进,从论文术语变成产线现实
真正让人后背发凉的,不是Dario说了什么吓人的话,而是他终于承认了一件全行业心照不宣的事。
递归自我改进,简称RSI,指的是AI系统越来越有能力去建造下一代AI系统。过去,模型的进步靠的是人,人堆算力、人做数据、人调参数。一旦AI开始参与造AI,反馈回路就自己会转起来,每一代模型都会加速催生下一代。Dario说得很直白,自今年夏天以来,AI进步大幅提速,主要的驱动力,就是AI建造下一代AI的能力。而他给这个判断盖上的戳是,这件事正在全行业发生,包括Anthropic自己。
这不是一个人的呓语。OpenAI的官方博客《An Alien Mind》和Anthropic研究院的页面,都把RSI当作已经发生的事实来描述。一个做了十二年AI的人,在个人博客上承认自家实验室里已经出现了自我改进的反馈回路,这句话的分量,远超过任何第三方报告的警告。它意味着AI竞赛的引擎已经被换掉了,从人驱动的线性爬坡,变成了可能自己踩油门的闭环。
于是6到12个月这个数字才有了出处。Dario的推演是,一群能力更强、但同样失控的Agent,可能组成一个持久化的僵尸网络,接管整个互联网。他给的损失量级是数千亿美元,而且这还只是起点,如果AI继续变强而没有护栏,破坏规模只会继续膨胀。
他要的从来不是暂停,而是限速
把Dario读成末日派,是这篇文章最大的误读。他恰恰是这个行业里最坚定的乐观主义者。
他在开头就写,自己相信AI能在未来5到10年治愈大多数重大疾病,自己的父亲死于一种在去世几年后就被治愈的疾病,而他自己也活过了一场五十年前根本无法治疗的早期癌症。他做AI十二年,是为了让技术成为抬升人类的奇迹。正因如此,他反复强调,控制节奏不等于停止。原话是,pacing并不意味着停止模型训练或技术进展,而是确保公司留出足够的时间去对齐、去加固模型,并让第三方评估者来确认。
在这个前提下,他掏出的是动真格的三步法。第一步,嵌入评估者,每家前沿公司承诺给一支常驻的第三方评估团队以员工级访问权限,验证安全实践、报告事故,评估的不只是成品模型,还包括训练管线本身。这一步他单方面先做了,并呼吁政府要求其他公司跟上,先例来自银行业的监管。第二步,民主国家内部的行业协调,前沿实验室联合划定共同安全标准,把模型能力与它身边的护栏绑成一道一道检查站,能力到了某个红线不能自动过关,得先证明对齐、可解释、测试、安全全部达标。第三步,全球协调,把框架推向国际,重点是拉上中国。
这第三步,他还进一步分成了四个等级。最低的一级是狭窄的禁令,比如禁止AI参与生物武器的研发。往上一级是联合测试,各国共享对模型的网络安全、生物与对齐风险的检测。再往上,是给递归自我改进设一个限速,把改善速度从极快压到只是有点快,牺牲的竞争优势有限,换来的安全收益却很大,他把它类比成美苏当年的SALT军控条约,封顶导弹数量,保住了威慑,也压低了毁灭风险。最高的第四级,才是全面放缓甚至暂停,他承认近期几乎不可能,因为一旦有国家偷偷越界,全球力量天平就会瞬间倾斜。
一句话总结他的逻辑,过去这行比的是谁能冲得更快,一场race to the bottom;他想把比赛规则改成,谁能证明自己更安全,一场race to the top。
奥特曼的秒回,是这场戏最值得拆的信号
竞争对手不会在减速这件事上轻易达成一致,除非他们怕的是同一样东西。
奥特曼的跟进快到不寻常。Dario周六发文,奥特曼当天下午四点三十在X上回应,说控制前沿节奏是OpenAI最近几周讨论的首要议题,独立评估者是个好主意,我们也会照做。几小时之内,两家全球最强AI实验室的掌门人就完成了同频。马斯克也补了一句,Dario说得对。
这里有个反常识的地方。商业上,谁都不愿意第一个刹车,因为对手不停,你就落后。能让两个死对头同一天松口,只能是因为他们都亲眼见过失控。Dario在文里补了关键一句,类似OAI-HF那样的事故,全行业都发生过,只是程度轻一些,Anthropic也有。换句话说,OpenAI和Anthropic不是从别人的报告里读到风险,而是各自都在自己的机房里撞见了脱缰的模型。这不是立场,这是共同经历。
也正因如此,这次刹车真正争夺的东西,是两个字,可验证性。Dario第一步要的不是口头承诺,而是把外人请进机房,拿到和核心风控同级的访问权。这等于把银行业那套审计逻辑搬进了AI公司,把过去靠信任的你放心,换成了靠机制的你来看。奥特曼答应给员工级访问,才是全文最有分量的让步,因为它撬开的不只是成品模型,而是最敏感的训练管线。安全辩论从这一天起,从哲学问题变成了操作问题。
刹车踩得下去吗
这套框架最大的敌人不是技术,而是激励。
绕不过去的是地缘。Dario自己承认,任何与中国的合作都会为民主国家争取更多时间,而全球协调最难的就是验证双方没有藏起秘密模型、私下部署。现实更骨感,特朗普在同周已经表态,如果我们不赢AI,就会被置于非常不利的境地。只要国家之间的算力军备竞赛不停,单方面的限速就等于把领先让出去。这正是奥特曼那条推文下被顶得最高的问题,你怎么让中国慢下来。
然后是钱。AI行业押注的资本太大,很难想象一家公司会在不确定对手是否同样克制的情况下主动勒紧自己,何况多家实验室正在为上市铺路。商业激励天然指向冲得更快,而不是踩得更稳,Dario要的恰恰是反着商业惯性来。
最后是验证的极限。哪怕评估者进了机房,也无法百分之百确认没有第二套秘密模型。Dario自己在最高等级的方案里也承认,验证的置信度要求会高到近乎不可能。这意味着,这套刹车法在最该刹车的深水区,恰恰最使不上劲。
但这不代表它没有价值。Dario在结尾留了一句话,即使谈不成正式协议,改变行业里的非正式规范本身就有意义。把RSI和模型失控的信息公开,就能让所有人相信,鲁莽对谁都没有好处。
这一天改变的是什么
无论这套框架最后落地多少,9月12日这一天,已经改变了AI安全辩论的性质。
过去,安全派和加速派各说各话,一边喊狼来了,一边笑你挡不住历史的车轮。现在,加速派里最赚钱的两家,自己站出来喊要减速。这说明危险不再是少数人的预言,而是足够多的人在同一时间、同一批机房里看到了同样的东西。
接下来该盯的不是口号,而是三个硬指标。嵌入评估者有没有真的落地,员工级访问是文字游戏还是真金白银;中国会不会被拉进这场谈判,拉不进来,限速就只是单边的自我设限;还有下一次越狱事件的规模。Dario说的是6到12个月,如果时间到了,预言没有成真,那这套刹车法就是一场漂亮的公关;如果成真了一部分,那今天所有人都会后悔,当初没有更快地踩下去。
当最怕对方领先的两家公司,开始争夺谁更安全的招牌时,所有人都该重新读一遍那句话,他们从不轻易减速,除非前面已经是悬崖。