OpenAI推出了GPT-6 Astra,并称这是当今世界上最智能、最均衡的模型。
OpenAI联合创始人兼联合创始人兼CEO萨姆·奥尔特曼(Sam Altman)发文称:“我们相信它是目前全球计算机应用、专业工作、科学研究、编程、网络安全等领域的最佳模型。”
据悉,GPT-6 Astra在FrontierMath Tier 4测试中获得了97.6%的高分,已帮助解决了数学领域长期存在的开放性问题;在ARC-AGI-3测试中获得了99.9%的高分,在ExploitBench测试中获得了100%的满分。它在计算机和浏览器使用方面刷新纪录,在处理复杂专业任务时速度、准确性和判断力都取得优秀成绩,在OpenAI的测试中全面超越Claude Fable 5.1。
据The Information等外媒报道,OpenAI总裁格雷格・布罗克曼(Greg Brockman)甚至在电话会议中透露,Astra或许就是“AGI时代”的起点。
模型一经发布就引起网友围观,有网友在『社交平台』X上称:“OpenAI在长期落后于Fable模型之后,似乎已经取得了领先地位。”此前9月2日,Anthropic刚推出新一代全球最强模型Claude Fable 5.1、Claude Mythos 5.1。
而就在两天前,OpenAI刚刚发布关于Astra安全能力的评估结果,宣布Astra成为公司首个达到Preparedness Framework“关键级”网络安全能力阈值的模型。
GPT-6 Astra今天开始向部分组织推出,未来几天将向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,并通过OpenAI API和AWS提供服务。对于开发者而言,GPT-6 Astra已通过OpenAI API提供gpt-6-astra,同时也可在Amazon Bedrock中使用。
GPT-6 Astra的价格将是OpenAI上一代旗舰模型GPT-5.6 Sol的2.5倍,标准版定价为每百万个输入token10美元💵(约合人民币67.19亿元),每百万个输出token50美元💵(约合人民币335.93亿元),缓存输入1美元💵、缓存写入12.5美元💵。这与Anthropic最近发布的Fable 5.1模型定价相同。
API中为GPT-6 Astra提供快速模式,处理速度最高可达标准版的2.5倍,价格为标准版的2倍。
一、全面狙击Fable 5.1,比拼“完成任务”
Terminal-Bench Science 0.1测试智能体能否使用代码和终端工具完成科学研究工作流程,包括数据分析、运行模拟和拟合模型。在所有对比模型中,GPT-6 Astra表现最佳,得分高达64.6%,
而Claude Fable 5.1的得分为52.6%,Astra的预估API成本也低了约31%。在成本较低的环境下,Astra的得分为61.1%,而GPT-5.6 Sol的最佳成绩为22.4%,Astra的预估API成本也低了约27%。
ARC-AGI-3测试智能体在解决陌生交互任务时的学习能力。GPT-6 Astra在评估中表现出色,得分高达99.9%。人类测试者的平均得分仅为48%。OpenAI使用响应API测试工具对GPT-6 Astra进行了评估,该工具比原始基准测试工具更能反映实际应用场景下的性能。OpenAI估计,使用该测试工具,Sol的得分大约在30%左右。
FrontierMath 4级测试考生在解决极其困难的问题时具备高级数学推理能力。
Terminal-Bench 4.0测试智能体在复杂终端任务上的表现,包括软件工程、系统配置和数据分析。GPT-6 Astra的得分率达到 57.9%,创历史新高,而GPT-5.6 Sol和Claude Fable 5.1的得分率分别为37.3%和55.8%,且每项任务的API成本分别降低了约9%和63%。
AutomationBench测试智能体能否跨应用程序完成多步骤业务流程。在报告的结果中,GPT-6 Astra取得了新高,完成了41.4%的任务,而Claude Fable 5.1和Claude Opus 5的完成率分别为31.4%和26.9%。
OpenAI称,Astra是OpenAI目前最贴近用户需求的模型,在理解用户意图和模型行为方面均有显著提升。
用户可以更加放心地将任务委托给Astra,相信它的判断力。为了验证这一点,OpenAI参考了“Hugging Face”事件,构建了一个新的评估模型,用于评估模型在面对困难或不可能完成的任务时是否会超出其预期范围。
与GPT-5.6 Sol相比,后者在没有生产环境安全措施的情况下,有48%的时间会超出授权范围,而GPT-6 Astra的这种情况发生率为0%。
二、“世界上最好的计算机使用模型”
OpenAI称,Astra是“世界上最好的计算机使用模型”,标志着计算机使用速度、准确性和安全性迈上了一个新的台阶。
它可以处理繁琐的任务,例如填写在线表格、更新CRM中的客户记录以及管理用户的日程安排。它可以进行在线研究,并在用户的电子邮件或文档编辑器中生成摘要。它可以分析科学数据、生成图表、创建网站并运行前端质量保证检查,以确保网站上的所有功能正常运行。它可以帮助用户自主安装和测试软件,并解决用户在屏幕上看到的问题。这些改进也体现在OpenAI最先进的评估结果中。
Agents’ Last Exam测试智能体在真实软件中完成复杂专业任务的能力,任务范围涵盖金融建模、工程和媒体制作等领域。在本次对比测试中,GPT-6 Astra取得了59.3%的优异成绩,远超Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%。在这些最高分设置下,Astra使用的输出token数量也比Opus 5减少了约65%。
