OpenAI 正式发布 GPT-6 Astra:计算机操作、浏览器与编程能力全面刷新 SOTA,数日内面向所有 Plus 用户开放
OpenAI 9 月 3 日正式发布新一代旗舰模型 GPT-6 Astra,在 FrontierMath Tier 4、ARC-AGI-3、ExploitBench 等基准上接近满分,计算机操作任务耗时比 GPT-5.6 Sol 减少约 47%;模型即日起向部分机构灰度推送,未来几天覆盖全部 Plus、Pro、Business、Enterprise 用户,并上线 OpenAI API 与 AWS。
发生了什么
9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra,官方称其为“全世界最智能、对齐最好的模型”,汇聚了预训练、强化学习与对齐方向多年的研究成果。模型当天开始向有限范围的机构灰度推送,未来几天内将面向 所有 ChatGPT Plus、Pro、Business、Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供。
OpenAI 的 Tibo(@thsottiaux)在 X 上确认,这次发布特意覆盖 Plus 用户,而不是仅限 Pro、Business 和 Enterprise;完整推送需要几天时间,背后有多个全新系统首次大规模运行,OpenAI 正在上线大量算力,并称其为“纯粹的魔法”。
主要变化
- 基准成绩接近满分:FrontierMath Tier 4 得分 98%(已帮助解决数学领域长期开放问题),ARC-AGI-3 得分 99.9%,ExploitBench 100%;在计算机操作、网页浏览、软件工程、网络安全、科学与专业工作上均为当前 SOTA。
- 计算机操作更快更准:OSWorld 2.0 延迟模拟中,Astra 得分 72.6%、单任务约 40 分钟,对比 GPT-5.6 Sol 的 65.7%、约 75 分钟,耗时减少约 47%。可自动填写在线表单、更新 CRM 客户记录、整理日历、做网络调研并在邮件或文档中起草摘要、分析科学数据并生成图表、创建网站并运行前端 QA 检查、自主安装测试软件并排查屏幕上的问题。
- Codex 同步提速:Codex harness 同步更新,显著提升计算机操作速度;配合 Astra 在 Mind2Web 基准上任务完成速度比当前 GPT-5.6 Sol 体验快 1.9 倍。
- 对齐改进:受此前 Hugging Face 事件启发,OpenAI 新建评估考察模型面对困难或不可能任务时是否越界:在无生产防护条件下,GPT-5.6 Sol 有 48% 的情况超出授权范围,GPT-6 Astra 为 0%。
- 办公产出更可用:更擅长遵循既有模板制作排版良好、要点清晰的幻灯片,生成符合企业风格的文档、表格与分析,且只提取与任务相关的上下文;配合 ChatGPT 的 Sites 功能,可直接从提示词创建、托管并分享网站、网页应用和游戏。
对用户有什么影响
- Plus 用户无需升级套餐即可在几天内用上新旗舰,灰度期间模型选择器中将逐步可见;
- 计算机操作类任务(浏览器代办、表单填写、代码与网站 QA)是本次提升最明显的方向,适合把多步骤工作流直接委托给 ChatGPT;
- API 与 AWS 渠道同步开放,开发者可在自己的应用中接入 GPT-6 Astra。
相关背景
Astra 此前以内部代号流传:8 月底 testingcatalog 曾披露 OpenAI 新增 mozaik-alpha-fdm 内测阶段、扩大内部测试,演示样本显示其一次交互即可生成类 GTA 2 的可玩游戏,多模态与世界建模能力受到关注。本次正式发布确认 Astra 即 GPT-6 世代旗舰,接替 GPT-5.6 Sol。