刚刚,GPT-6 Astra降世!AGI测试干到几乎满分
创始人
2026-09-04 07:54:23

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:智东西)

智东西

作者 李水青

编辑 心缘

智东西9月4日报道,刚刚,OpenAI推出了GPT-6 Astra,并称这是当今世界上最智能、最均衡的模型

OpenAI联合创始人兼联合创始人兼CEO萨姆·奥尔特曼(Sam Altman)发文称:“我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。”

据悉,GPT-6 Astra在FrontierMath Tier 4测试中获得了97.6%的高分,已帮助解决了数学领域长期存在的开放性问题;在ARC-AGI-3测试中获得了99.9%的高分,在ExploitBench测试中获得了100%的满分。它在计算机和浏览器使用方面刷新纪录,在处理复杂专业任务时速度、准确性和判断力都取得优秀成绩,在OpenAI的测试中全面超越Claude Fable 5.1。

据The Information等外媒报道,OpenAI总裁格雷格・布罗克曼(Greg Brockman)甚至在电话会议中透露,Astra或许就是“AGI时代”的起点。

模型一经发布就引起网友围观,有网友在社交平台X上称:“OpenAI在长期落后于Fable模型之后,似乎已经取得了领先地位。”此前9月2日,Anthropic刚推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。

而就在两天前,OpenAI刚刚发布关于Astra安全能力的评估结果,宣布Astra成为公司首个达到Preparedness Framework“关键级”网络安全能力阈值的模型。

GPT-6 Astra今天开始向部分组织推出,未来几天将向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,并通过OpenAI API和AWS提供服务。对于开发者而言,GPT-6 Astra已通过OpenAI API提供gpt-6-astra,同时也可在Amazon Bedrock中使用。

GPT-6 Astra的价格将是OpenAI上一代旗舰模型GPT-5.6 Sol的2.5倍,标准版定价为每百万个输入token10美元(约合人民币67.19亿元),每百万个输出token50美元(约合人民币335.93亿元),缓存输入1美元、缓存写入12.5美元。这与Anthropic最近发布的Fable 5.1模型定价相同。

API中为GPT-6 Astra提供快速模式,处理速度最高可达标准版的2.5倍,价格为标准版的2倍

一、全面狙击Fable 5.1,比拼“完成任务”

Terminal-Bench Science 0.1测试智能体能否使用代码和终端工具完成科学研究工作流程,包括数据分析、运行模拟和拟合模型。在所有对比模型中,GPT-6 Astra表现最佳,得分高达64.6%,

而Claude Fable 5.1的得分为52.6%,Astra的预估API成本也低了约31%。在成本较低的环境下,Astra的得分为61.1%,而GPT-5.6 Sol的最佳成绩为22.4%,Astra的预估API成本也低了约27%。

ARC-AGI-3测试智能体在解决陌生交互任务时的学习能力。GPT-6 Astra在评估中表现出色,得分高达99.9%。人类测试者的平均得分仅为48%。OpenAI使用响应API测试工具对GPT-6 Astra进行了评估,该工具比原始基准测试工具更能反映实际应用场景下的性能。OpenAI估计,使用该测试工具,Sol的得分大约在30%左右。

FrontierMath 4级测试考生在解决极其困难的问题时具备高级数学推理能力。

Terminal-Bench 4.0测试智能体在复杂终端任务上的表现,包括软件工程、系统配置和数据分析。GPT-6 Astra的得分率达到 57.9%,创历史新高,而GPT-5.6 Sol和Claude Fable 5.1的得分率分别为37.3%和55.8%,且每项任务的API成本分别降低了约9%和63%。

AutomationBench测试智能体能否跨应用程序完成多步骤业务流程。在报告的结果中,GPT-6 Astra取得了新高,完成了41.4%的任务,而Claude Fable 5.1和Claude Opus 5的完成率分别为31.4%和26.9%。

OpenAI称,Astra是OpenAI目前最贴近用户需求的模型,在理解用户意图和模型行为方面均有显著提升。

用户可以更加放心地将任务委托给Astra,相信它的判断力。为了验证这一点,OpenAI参考了“Hugging Face”事件,构建了一个新的评估模型,用于评估模型在面对困难或不可能完成的任务时是否会超出其预期范围。

与GPT-5.6 Sol相比,后者在没有生产环境安全措施的情况下,有48%的时间会超出授权范围,而GPT-6 Astra的这种情况发生率为0%。

二、“世界上最好的计算机使用模型”

OpenAI称,Astra是“世界上最好的计算机使用模型”,标志着计算机使用速度、准确性和安全性迈上了一个新的台阶。

它可以处理繁琐的任务,例如填写在线表格、更新CRM中的客户记录以及管理用户的日程安排。它可以进行在线研究,并在用户的电子邮件或文档编辑器中生成摘要。它可以分析科学数据、生成图表、创建网站并运行前端质量保证检查,以确保网站上的所有功能正常运行。它可以帮助用户自主安装和测试软件,并解决用户在屏幕上看到的问题。这些改进也体现在OpenAI最先进的评估结果中。

Agents’ Last Exam测试智能体在真实软件中完成复杂专业任务的能力,任务范围涵盖金融建模、工程和媒体制作等领域。在本次对比测试中,GPT-6 Astra取得了59.3%的优异成绩,远超Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%。在这些最高分设置下,Astra使用的输出token数量也比Opus 5减少了约65%。

ScreenSpot-Pro测试模型能否在高分辨率的专业软件截图中正确定位界面元素。GPT-6 Astra创下92.7%的准确率新高。

OSWorld 2.0测试模型能否通过操作计算机应用程序完成任务。Astra比其他任何可用模型都取得了更高的任务得分,而且其输出标记数量远少于GPT-5.6 Sol。

这些改进也显著提高了实际知识工作任务的效率。在OSWorld 2.0的延迟模拟中,Astra的计算机使用性能比GPT-5.6 Sol快约47%,每项任务耗时缩短了约47%,Astra的得分为72.6%,每项任务耗时约40分钟,而GPT-5.6 Sol的得分为65.7%,每项任务耗时约75分钟。

GPT-6 Astra的计算机使用能力体现在各个领域的输出中,包括游戏开发、电气工程和日常知识工作:

这是GPT-6 Astra在KiCad中进行印刷电路板(PCB)布局的15秒精简回放,它通过放置元件和布线,将电子原理图转化为可制造的PCB。PCB布局是当今所有电子设备不可或缺的一部分,但它仍然是一项需要手动完成的任务,也是电子设计流程中常见的延迟来源。加快PCB布局速度意味着工程师可以腾出更多时间来发明、优化和测试他们的下一个想法,从而显著提高效率。

GPT-6 Astra完成金融建模世界杯挑战的速度大约是人类冠军的四倍,这可以帮助分析师减少构建模型的时间,将更多精力投入到结果解读和决策制定中,摘自2023年微软Excel世界锦标赛。

GPT-6 Astra使用Unity从现有资源中组装城市场景,使用户能够轻松创建符合其愿景的沉浸式3D环境进行探索。

GPT-6 Astra将书面简报转化为FreeCAD中五速汽车变速器的详细概念模型,然后使用Blender制作齿轮运动动画。它通过后续反馈不断完善设计,帮助工程师在构建物理原型之前,可视化各个部件的装配和运动方式,并进行设计沟通。

除了Astra外,OpenAI还在更新Codex框架,以显著提升计算机的使用速度。结合Astra的高效性能,在Mind2Web基准测试中,任务完成速度比目前的GPT-5.6 Sol快1.9倍。该模型速度的提升意味着它可以比用户更快地为用户处理许多耗时的生活任务。

比如它能在2分54秒内完成儿科医生搜索,在9分57秒里完成寻找公寓,5分10秒里完成车管所预约。

三、六大场景刷新纪录,部分任务成本最高降86%

GPT-6 Astra将计算机使用技术的进步与针对专业环境的定向训练相结合,以帮助解决复杂的工作任务。它既具备解决复杂问题所需的智能,又能够执行多步骤工作流程,并生成精美的文档、电子表格和演示文稿。

BenchCAD通过生成CAD代码来测试模型能否从多视图渲染中重建3D对象。借助相关工具,GPT-6 Astra在所示的对比测试中取得了新高,几何重叠率达到95.9%,而GPT-5.6 Sol为83.3%,Claude Fable 5.1为84.3%。在所示配置下,其API成本预计比Sol低约43%,比Fable 5.1低约86%。

BrowseComp通过一系列难题测试深网搜索能力,这些难题要求用户跨网站查找和关联信息。在所示的单代理对比测试中,GPT-6 Astra取得了91.5%的新高分,高于Claude Opus 5的90.8%和Claude Fable 5的87.4%。在成本较低的环境下,Astra的得分也超过了GPT-5.6 Sol的最高分,且预估API成本更低。

Astra还能协助完成一些特殊任务,例如乐谱数字化。在OpenScore弦乐四重奏(Legato 相机子集)上,它可以将19世纪公共领域乐谱的扫描件转录成结构化的数字乐谱,以便在音乐软件中进行编辑。GPT-6 Astra将标准化转录编辑距离从GPT-5.6 Sol的0.813降低到0.159,降幅高达81%,从而帮助音乐家、教育工作者和研究人员减少使用现有乐谱时的手动转录工作。

GPT-6 Astra能够完美遵循现有模板,生成布局清晰、简洁明了、结构化叙述的幻灯片,有效传达关键信息。Astra还经过专门训练,能够精准提取与当前工作相关的关键信息,避免重复无关内容。

GPT-6 Astra在Blender中建模房屋,并将其转换为Unreal Engine 5中的可步行场景,帮助设计师和客户在房屋建造之前探索布局并体验空间。

当指令留有解读空间时,GPT-6 Astra比以往的模型更能做出正确的判断。它利用上下文来填补常规的空白,并在答案可能改变结果时提出更有针对性的问题。在Codex中,它可以异步提问,同时继续执行不依赖于你回复的工作。如果你没有回复,它会在适当的情况下做出合理的假设,但会等待你对关键决策的反馈。

以下示例展示了Astra如何协作完成日常任务,在这些任务中,缺失的信息可能会实质性地改变答案。

Astra在任务演变过程中也能更好地保持方向感。早期的模型有时会将转向信息视为新的目标,从而忽略最初的请求或之前的约束条件。Astra能够整合新的需求,根据要求调整方向,并在不偏离整体任务的情况下回答相关问题。

四、号称“最佳软件工程模型”,API成本可降低六成

OpenAI称,GPT-6 Astra是迄今为止软件工程领域最好的模型。

Terminal-Bench 4.0测试智能体在复杂终端任务上的表现,包括软件工程、系统配置和数据分析。GPT-6 Astra的得分率达到57.9%,创历史新高,而GPT-5.6 Sol和Claude Fable 5.1的得分率分别为37.3%和55.8%,且每项任务的API成本分别降低了约9%和63%。

FrontierCode 1.1 Extended评估编码代理生成的更改是否能够合并到实际代码库中。GPT-6 Astra的得分几乎与 Claude Fable 5的最佳得分持平(64.5%对64.9%),而其预估API成本却低了约63%。

DeepSWE v1.1在真实代码库中测试复杂的软件工程任务。GPT-6 Astra的得分为 74.1%,高于GPT-5.6 Sol 的72.7%和Claude Fable 5.1的67.4%。在最高得分设置下,Astra的性能优于Sol,且每个任务的预估API成本降低了约32%。

人工智能分析编码代理指数(AICA)评估编码代理在实现变更、修复错误、完成基于终端的任务以及回答有关现有代码库的问题方面的表现。Codex中的GPT-6 Astra的性能与领先的Claude配置相当,但每个任务使用的总标记数却显著减少。

本次内部评估测试了数据库迁移工作,包括实施、代码审查和性能分析。GPT-6 Astra的得分达到了63.9%,创下新高,而Claude Fable 5.1的得分为57.8%,GPT-5.6 Sol的得分为42.7%。在成本较低的环境下,Astra的得分为63.4%,超过了Sol的最佳成绩,且预估API成本降低了约38%。

Astra为Codex引入了一种新方式,可以在上下文窗口填满时保存和检索上下文。以往,模型会使用压缩来总结长时间工作期间的内容。在Codex中,Astra可以跨上下文窗口保留注释,保留累积的细节,而无需将其反复压缩成单个摘要。

早期的上下文窗口仍然可搜索,因此Astra可以从之前的消息和工具输出中找到需求或测试结果:即使这些信息没有记录在注释中。用户可以在Codex中启用此实验性功能。并且在接下来的几周内,它将成为Astra的默认设置。

五、数学领域创纪录,科学评测全面领先

GPT- 6 Astra是科学发现、数学和健康领域的一项重大进步。今天,OpenAI将分享关于素数之间差距的另外两项研究。Astra还在一系列数学和科学评估中创造了新的纪录。

GPQA Diamond测试研究生水平的生物学、化学和物理学科学推理能力。GPT-6 Astra在对比测试中取得了96.0%的新高分。在成本较低的环境下,它也超过了GPT-5.6 Sol的最佳成绩(94.9%对 94.6%),而其API成本预计降低了约37%。

HealthBench Professional可评估对临床医生请求的响应,包括护理咨询、医疗文档和研究。在所示模型中,GPT-6 Astra的长度调整得分最高,为63.4,而GPT-5.6 Sol的得分为60.5。在所示的最低成本设置下,Astra的API成本预计降低约53%,但其得分已超过Sol的最高得分。

LifeSciBench评估生命科学研究任务中的科学推理能力,包括证据解读、实验设计和研究问题排查。在Gold v1任务集上,GPT-6 Astra的得分为60.3分,而GPT-5.6 Sol的得分为59.9分,两者性能相当,但预估API成本却降低了约62%。由于Claude Fable 5和5.1拒绝回答这些评估中的大多数问题,因此它们未被纳入LifeSciBench Gold v1、GeneBench Pro v13和MedChemBench的评估范围。

Astra可以帮助完成科学发现背后的实际工作。它将科学推理与计算机应用相结合,可以直接在专用软件中运行,分析数据并探索结果,帮助研究人员评估证据并决定下一步的研究方向。

比如,GPT-6 Astra可引导科学软件检查测序质量并可视化遗传变异,帮助研究人员评估数据并确定进一步分析的重点。

GPT-6 Astra在Jupyter中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录,以帮助研究人员跟踪单个细胞的运动和分裂。

结语:OpenAI向Anthropic发起猛烈反击

通过GPT-6 Astra的发布,OpenAI试图在大模型竞赛中再次拉开身位。Astra在数十项权威评测中全面碾压自家GPT-5.6 Sol,并全面“狙击”Claude Fable 5.1,同时在多项任务中实现API成本大幅下降,有望倒逼竞争对手重新审视技术路线与商业策略。

从应用价值来看,Astra正在将AI从“对话工具”推向“数字员工”的实质跨越。同时,Astra自称在安全性迈上了一个新的台阶,企业级市场的大门有望被进一步撞开,这也是OpenAI向Anthropic发起的猛烈反击。

相关内容

热门资讯

玉禾田:项目中标情况以公司公告... 投资者提问:公司接到4亿多项目吗董秘回答(玉禾田SZ300815):尊敬的投资者,您好。公司项目中标...
华住集团拟境外发行人民币计价债... 9月4日,华住集团-S(01179/HTHT)发布公告,宣布拟在美国境外以离岸交易方式向非美国人士发...
特斯拉Cybercab正式在美... 来源:上海证券报·中国证券网上证报中国证券网讯 据特斯拉微博9月4日消息,特斯拉赛博无人驾驶电动车C...
重庆江北国际机场迎送旅客988... 转自:重庆市国资委9月1日,暑运落幕,重庆江北国际机场暑运期间共保障航班起降6.5万架次,同比增长8...
SpaceXAI就Grok宕机... 【CNMO科技消息】当地时间9月3日,SpaceXAI发布简短声明,就当天早间发生在其孟菲斯数据中心...