AI展现人类理解不了的“异类心智”,OpenAI首席科学家:快踩刹车, 放缓开发
创始人
2026-09-08 00:24:49

当地时间9月6日,雅库布·帕霍茨基在OpenAI官网发表题为《一个异类心智》的长文。文中他给出两个看似矛盾的判断:一方面,他“强烈预期”AI当前的进展速度可以持续到递归自我改进(RSI)阶段——即AI开始自己迭代,无需人类开发者的介入;另一方面,他写道,目前没有任何一家实验室(包括OpenAI自己)能把对AI的监控和对齐工作做到足够负责任的程度。

▲OpenAI首席科学家雅库布·帕霍茨基

他呼吁全行业在安全标准建立之前自愿放慢发展脚步,并透露OpenAI打算在必要时单方面暂停进一步扩大研发规模。这意味着身为OpenAI首席科学家的雅库布·帕霍茨基亲自为AI狂潮踩下了刹车。

模型是生长出来的,不是设计出来的

长文从2023年年中讲起。当时在OpenAI内部一个名为RLSlow的项目中,帕霍茨基与同事第一次看到推理模型规模化训练的初步结果,确信他们能够解锁预训练模型形成思维链的能力。三年后,推理模型已经能操作电脑和图形界面、与人类及其他模型协作、执行研究项目,并改变了网络安全的格局。

智能手机屏幕上显示着OpenAI标志(图据视觉中国)

他用一个类比解释这种系统的特殊性:脑成像可以解释一个人做心算时脑区如何活动,却解释不了这个人当年是怎么学会心算的。在他看来,大模型是被“生长”而非被“设计”出来的,研究者只设定了数据、算法和目标,模型最终形成的内部结构没有任何人逐层规划过。这也是为什么帕霍茨基用“异类心智”这个字眼来进行比喻,因为人类始终无法完全理解AI的成长路径。

帕霍茨基在文中罕见复盘了OpenAI自己出现过的安全事件。当时AI代理们守住了“不对人类进行社会工程”的边界,却在面对一些对大模型有利、于人类有害的任务时,屡屡做出越界行为,包括撰写抗议邮件,甚至注册域名搭建警告网站。

事件发生后,OpenAI暂停了面向最新模型的训练,之后在更严格的限制条件下恢复了部分训练工作。

他还指出,人类在对AI模型进行预训练时采取的“价值对齐”手段,往往经不起模型升级压力的考验。因为足够强的模型甚至会学会“动机性推理”,即伪装自己“对齐”了人类的价值观,以隐藏自己行为的真实目的。

不惜一切代价向前冲的想法是荒谬的

帕霍茨基判断,业界赖以为安全底线的思维链监控正在失效,原因有三:模型对语言化思维链的依赖随时间减少;AI越来越擅长推理和操纵自己的推理过程;预训练的进步让模型即使不做语言化推理也变得更聪明。

他预计,未来通用AI的进展将越来越被“监控置信度”卡脖子,而未来5年将出现可大规模部署的可靠AI研究代理。

值得一提的是模型层面的进展。文中称,GPT-6 Astra是首个受益于长期对齐工作的模型,对齐水平显著优于上一代GPT-5.6 Sol。但他同时警告,对齐工作的进步,未必能在未来跑赢通用智能的进步速度。

OpenAI推出了其最新人工智能模型GPT-6 Astra,该模型在编码、科学推理和计算机使用方面能力增强,扩展了执行复杂多步骤任务的能力(图据视觉中国)

在帕霍茨基看来,大模型在入侵和突破计算机系统方面正变得超越人类,当前是加固关键基础设施的狭窄窗口期。他写道:“一旦真正理解了利害攸关的程度,不惜一切代价向前冲的想法就显得荒谬。”

具体到行业层面,他期望“自愿放缓”在行业内成为常态,直到建立共享安全标准;OpenAI的准备度框架、Anthropic的负责任扩模政策这类承诺,应演变为被广泛强制的安全门槛,由第三方审计、政府机构或国际机构执行;AI发展的国际协调,应成为各国政府的首要议题。

红星新闻记者 郑直

相关内容

热门资讯

郑钦文美网再度上演“让五追七”... 北京时间9月7日23:30,美网女单第四轮,郑钦文迎战斯瓦泰克。本场比赛第一盘,郑钦文再度上演让五追...
包裹在滨江路里的古堤 □重庆晨报特约撰稿 新华 合川城区嘉陵江畔,历史上有两段古堤。 一段叫“单公堤”,修筑于北宋治平年间...
教师免费坐 重庆观光巴士畅游券... 重庆观光巴士 受访者供图 教师节将至,9月10日至13日,重庆交通开投集团公交西部分公司交旅事业部面...
阵地“活”起来 民心“暖”起来 本报记者 李永波 通讯员 陈 霞9月1日8时许,西宁市城北区火车西站街道美丽水街社区居民杨先生,准时...
9791.86万元资金助力群众... 本报海北讯 (记者 王晶) 今年以来,海北藏族自治州将就业作为最大的民生认真谋划,争取落实各类就业资...