北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。发布会上,总裁格雷格·布罗克曼的一句话引爆了整个AI圈:"欢迎来到AGI时代。"
这不是一个简单的产品更新。这是OpenAI第一次在旗舰模型发布时,直接触碰那个争议最大、也最敏感的话题——通用人工智能是否已经到来。
从基准测试来看,Astra确实带来了肉眼可见的提升:
更值得关注的是计算机使用能力(Computer Use)的突破。在OSWorld 2.0测试中,Astra完成任务的平均耗时从75分钟缩短到40分钟,效率提升近一倍。这意味着它不再是"能聊天的模型",而是真正开始具备"替你干活"的能力。
布罗克曼在发布会上承认,AGI仍是一个"模糊不清的概念"。他试图重新定义它——不再是合同条款里的触发条件,而是一种"使命概念"或"精神概念"。
这种修辞策略本身就在传递一个信号:OpenAI知道,如果严格定义AGI,现在远未达到标准。但如果换一种叙事方式,让公众自行判断,舆论就会导向"我们已经到了"。
这本质上是一种营销优先的技术声明。
更值得注意的是基准测试的选择性呈现。当被问及与Meta Muse Spark的竞争时,OpenAI没有纳入Muse的最新数据(75.4%)。在DeepSWE v1.1榜单中,Gemini 3.8 Flash和Claude Opus 5的得分都是74%,与Astra的74.1%处于同一误差范围内。
当一家公司说"我们最强"时,观众需要问的是:最强的维度是什么?排除掉了哪些竞争对手?
OpenAI宣称Astra是"最对齐的模型",其越界率从Sol的48%降到了0%。这确实值得称赞,但有两个细节需要审视:
第一,这48%的对比是在"没有生产级安全防护措施"的环境测试的,而Astra是在完整防护体系下测试的。两者的安全基线并不对等。
第二,OpenAI首席科学家雅库布·帕霍茨基透露了一个更深层的问题:Astra的推理过程比Sol更难监控。智能进步并不意味着对齐进步,反而可能带来新的风险。
更令人不安的是网络安全能力的跃升。Astra在ExploitBench测试中得分100%,并能发现未被记录的漏洞。OpenAI对此的反应是收紧访问权限——通过Daybreak计划只向经过审核的研究人员开放。
当一个模型能比人类更快发现系统漏洞时,"安全"与"危险"的界限会变得极其模糊。
Astra的API定价是每百万输入token 10美元,输出50美元。这几乎是Sol促销价的2.5倍,是Meta Muse的10倍,是Gemini 3.8 Flash的13倍。
OpenAI的解释是:真正重要的是"每个任务的成本"。如果模型用更少的步骤完成任务、减少重试次数,总成本可能更低。
但这仍然是一个奢侈的定价。对于普通用户而言,Astra带来的体验提升能否抵消价格的指数级上涨?答案恐怕是否定的。
这意味着Astra将主要服务于企业客户和专业开发者,而不是大众用户。OpenAI正在构建的,是一个分层清晰、价格陡峭的AI世界。
GPT-6 Astra确实是当前最强大的通用语言模型之一,这一点毋庸置疑。但"AGI时代"的宣言,更像是一次精心策划的营销事件,而非严谨的技术里程碑。
我们正站在一个有趣的历史节点上:AI的能力确实在飞速进步,但这种进步是否足以支撑"AGI"这个沉重的标签?答案可能需要更多时间来验证。
或许更重要的是:当我们谈论AGI时,我们究竟在期待什么?是更高效的工作工具?是更聪明的助手?还是一场彻底改变人类文明形态的技术革命?
对于后者,Astra还远远不够。但对于前者,它确实迈出了重要的一步。
AGI也许还没有到来,但AI时代正在以更具体的方式重塑我们的一切。
OpenAI发布GPT-6 Astra,称已进入"AGI时代" - 腾讯新闻