北京时间2026年9月4日凌晨,OpenAI正式发布新一代旗舰模型GPT-6 Astra。“Astra”在拉丁语中意为“星辰”,OpenAI将其定义为“新一代智能”。在发布会最后,OpenAI总裁格雷格·布罗克曼直接宣告:“Welcome to the AGI era.”(欢迎来到AGI时代)。

GPT-6被定义为“地球最强大模型”,它不仅仅是一次模型升级,而是从“回答问题”向“直接完成工作”的根本性转变。以下从四个维度来拆解它“强”在哪里:
架构:从“大力”到“巧力”的范式跃迁
GPT-6的内部代号叫“Spud”(土豆)。它采用MoE(混合专家)架构和全新设计的Symphony架构,将MoE稀疏激活、双系统推理、原生多模态三者统一在一个框架内。
一个反直觉的事实是:GPT-6的总参数量达到5到6万亿,但实际推理时只激活大约10%——约5000到6000亿参数。MoE架构的核心思想是“只请需要的专家出场”——模型内部有大量“专家网络”,每次推理只激活与当前任务最相关的一小部分。这意味着OpenAI不再走“大力出奇迹”的老路,而是转向“巧力出奇迹”。
训练规模同样惊人:在得克萨斯州Stargate园区动用超过10万块GPU完成预训练。研发周期约18个月,训练投入超过20亿美元。GPT-6也是OpenAI第一款由前代模型深度参与训练监督的旗舰产品。
原生多模态:一套架构搞定所有
GPT-6首次实现了文本、图像、音频、视频的原生统一处理,而非行业内常见的多模态模块拼接。上下文窗口达到200万Token(此前传闻)/实际发布105万Token,最大输出128000 Token,知识截止时间为2026年4月30日。
Computer Use:从“聊天”到“干活”
GPT-6 Astra最核心的突破在于电脑操作(Computer Use)能力。它可以直接通过屏幕、键盘和鼠标这套人类沿用了几十年的通用接口,像人一样观察环境、理解状态并准确操作。传统AI依赖API适配软件,而Astra能够绕过繁琐的API限制,从自然语言意图直接抵达最终结果。
用户可以直接给一个目标,比如“帮我整理一份财务分析并做成演示文稿”或“开发一个游戏原型并测试它是否能正常运行”——模型自己拆解任务、调用工具、持续执行,再把最终结果交付出来。
网络安全:达到“关键”级别
GPT-6 Astra是OpenAI首个在网络安全风险评估中达到 “关键”(Critical)级别的模型。在网络安全测试ExploitBench中得分100%,在利用漏洞测试ExploitGym中得分42.4%(前代GPT-5.6 Sol为30.3%)。测试过程中,Astra甚至发现并利用了两个新的零日漏洞。
不过,目前发布的版本仅限于防御性任务(如安全代码审查和漏洞修复),更高级的漏洞利用能力暂时被封锁。OpenAI计划通过Daybreak网络安全项目逐步向可信用户放开更多能力。
二、两个关键疑问与解答
疑问一:GPT-6比GPT-5到底强了多少?
从基准测试成绩来看,GPT-6相对于前代的提升堪称“代际跃迁”。
ARC-AGI-3(陌生环境推理测试):GPT-6得分99.9%,而GPT-5.6 Sol仅为7.8%
FrontierMath Tier 4(高难度数学):GPT-6得分97.6%,已接近饱和
ExploitBench(网络安全漏洞利用):GPT-6得分100%,前代为78.5%
GPQA Diamond(研究生级科学问答):GPT-6得分96%
Terminal-Bench 4.0(编程能力):GPT-6得分57.7%,GPT-5.6 Sol为37.3%
OSWorld 2.0(计算机操作):GPT-6得分72.6%,任务耗时从75分钟降至40分钟,效率提升约47%
OpenAI宣称,GPT-6在编码、推理和智能体任务上的表现比GPT-5.4高出40%以上。这绝非渐进式的小幅改进,而是一次质的飞跃。
疑问二:GPT-6普通人能用得起吗?
可以,但有门槛。
GPT-6 Astra将分阶段向用户开放。初期仅向参与OpenAI Daybreak网络安全项目的部分组织和企业用户开放。未来几天将逐步向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,同时通过OpenAI API和AWS提供服务。
定价方面,GPT-6 Astra的API价格为每百万输入Token 10美元、输出Token 50美元,是GPT-5.6 Sol(输入4美元、输出20美元)的2.5倍。当输入超过27.2万Token后,价格还会翻倍。
对于普通用户来说,这确实不便宜。但对于需要完成复杂端到端工作的企业用户,Astra“能直接交付成果”的能力意味着更高的投入产出比——它不再只是生成文字,而是可以直接完成一份财务报告、一个网站甚至一个游戏原型。
三、GPT-6带来的核心好处
1. 从“聊天”到“干活”的范式转变
GPT-6 Astra最核心的突破在于它不再只是一个聊天机器人。它可以自主完成填写在线表格、更新CRM客户记录、整理日程;进行在线研究并起草摘要;分析科学数据、生成图表、创建网站并运行前端质量检查。法律科技公司Legora使用Astra进行财务报表审阅,一次运行中几分钟审阅41份文件,同时发现了人为埋设的4处错误。
2. 多模态原生统一,打破信息壁垒
Astra首次实现了文本、图像、音频、视频的原生统一处理。这意味着用户可以在同一个对话中处理跨模态的复杂任务——输入一张草图,输出一个3D模型;输入一段音频,生成一份文字报告。信息不再被格式割裂。
3. 接近AGI的推理与适应能力
ARC-AGI-3测试专门考验模型在陌生环境中的适应能力——不给规则说明,直接把模型扔进从未见过的环境,让它自己摸索。Astra拿到99.9% 的成绩,说明它面对从未见过、也没有现成解法的问题时,已表现出很强的自主探索和规则学习能力。
4. 对齐与安全的大幅提升
OpenAI设计了一项新评估,测试模型在面对困难或不可能完成的任务时是否会超出预期范围。结果显示,GPT-5.6 Sol在缺乏防护措施的情况下,有48% 的测试案例越界;而GPT-6 Astra的越界比例为0% 。这是OpenAI“对齐程度最高的模型”。
5. 企业级生产力的真实落地
游戏开发公司Playco使用Astra进行游戏原型开发,人工修复工作减少50% 。Astra在CAD绘制BenchCAD中得分95.9% 。这些不是实验室里的“秀肌肉”,而是真实生产环境中的效率提升。
四、如何使用GPT-6——分步指南
第一步:确认访问权限
GPT-6 Astra目前处于分阶段开放状态:
当前可用:Daybreak网络安全项目的部分组织与企业用户
即将开放:ChatGPT Plus、Pro、Business和Enterprise用户
API渠道:通过OpenAI API和AWS提供服务
如果你是企业用户,可以通过OpenAI的企业销售渠道申请Daybreak项目访问权限。
第二步:选择使用方式
GPT-6提供两种主要使用方式:
ChatGPT界面:适合个人用户和轻量级任务,直接在对话界面中使用Astra
API调用:适合开发者将Astra集成到自己的应用中
API调用支持low、medium、high、xhigh和max五档推理强度,用户可以根据任务复杂度灵活选择。
第三步:理解定价与成本控制
GPT-6 Astra的API定价为:
计费项 价格(每百万Token)
输入Token(标准) $10
输入Token(缓存命中) $1
输出Token $50
当输入超过27.2万Token后,输入和缓存价格翻倍,输出升至75美元。建议在正式大规模使用前,先用小规模任务测试实际Token消耗量,评估成本。
第四步:从简单任务开始
由于Astra具备“直接完成工作”的能力,建议从以下类型的任务开始尝试:
文档生成:让Astra根据要求生成结构完整的报告、演示文稿
数据分析:上传数据,让Astra分析并生成图表
网页/应用开发:描述需求,让Astra生成可运行的代码和界面
多步骤工作流:给出一个完整目标,让Astra自主拆解执行
第五步:善用推理强度调节
Astra支持五档推理强度。简单任务用低档位节省成本,复杂推理任务切换到高档位获得更深入的思考。合理调节推理强度可以在保证质量的同时控制成本。
第六步:关注安全边界
Astra具备强大的能力,但当前版本在安全边界内运行。不要试图让Astra执行超出其授权范围的任务——系统内置了较强的越界防护机制。
五、实践案例与结果
案例一:法律科技公司Legora——几分钟审阅41份文件,发现4处人为错误
法律科技公司Legora使用GPT-6 Astra进行财务报表审阅。在相关基准测试中,Astra带来了约40% 的提升。更令人印象深刻的是,在一次Agent运行中,Astra用几分钟审阅了41份文件,同时发现了人为埋设的4处错误。对于传统需要数小时甚至数天才能完成的法律文件审查工作,Astra展示出了颠覆性的效率提升。
案例二:游戏开发公司Playco——人工修复工作减少50%,一个原型衍生三个主题
游戏开发公司Playco使用Astra进行游戏原型开发。在其测试中,人工修复工作减少50% ,并从一个灰盒基础原型制作出3个不同主题的游戏原型。这意味着原本需要一个团队数周才能完成的工作,现在可能缩短到几天甚至更短。
案例三:AGI前夜的“黑色三小时”——GPT-6发布同时,三大AI模型集体宕机
北京时间9月4日凌晨GPT-6发布的同时,美东时间9月3日上午,ChatGPT、Claude、Grok三大头部AI服务几乎同一时间出现大面积故障,全球故障报告超3.7万份。宕机持续约3小时40分钟。业内普遍认为这与三家厂商共享微软Azure云基础设施的“单点依赖”有关。
巧合的是,宕机发生时OpenAI恰好发布了GPT-6的预热视频,配文“The stars are almost aligned”(星星几乎排列好了)。被大量用户调侃——“醒醒,先把机房修好再炫耀吧”。这一事件也从侧面说明:最强大的模型也需要最可靠的基础设施支撑。
版权声明:本平台仅提供信息存储空间服务,用户发布内容不代表本站观点,交易风险自担;侵权违法内容请立即举报(邮箱:37996619@qq.com),本站接通知后先行屏蔽,责任由发布者承担。