GPT-6的欢迎仪式,会不会太隆重了。。。
(来源:科技头版)
GPT-6:欢迎来到AGI时代。
出品 | 科技头版 作者 | 范智林
今天凌晨,美国的前沿AI模型集体宕机罢工。
从当地时间的早晨九点半开始,OpenAI的ChatGPT与Codex、Anthropic的Claude、xAI的Grok,这几家大模型在相近的时间接连出现故障。
整场宕机事件持续了大约4小时,这4个小时里美国人短暂的重回了需要手工作业的原始时代。
非常有意思的是,当各大AI巨头服务集体中断时,OpenAI趁乱正式发布GPT-6 Astra,并高调宣布人类正式进入了AGI时代。
北京时间9月3日晚,OpenAI旗下ChatGPT与Codex、Anthropic旗下Claude,以及xAI旗下Grok,相继出现服务异常。
影响从聊天界面延伸到编程工具和API,部分用户无法正常提交请求或获得响应。
据报道,美国用户针对OpenAI服务的故障报告超过1.2万份,Claude约1200份,Grok约1000份。
Gemini、Copilot同期也收到用户报障,但谷歌并未确认Gemini发生全网宕机。
对于故障原因,各个巨头给出了不同的说法。
OpenAI给出了较明确的说明,只是一次路由错误导致部分用户无法使用ChatGPT和Codex,约34分钟后部署了解决方案,随后进入恢复监测。WIRED
Anthropic则确认时基础设施问题造成Claude网页、Claude Code、Claude Cowork及API部分中断。
SpaceX则将Grok故障归因于孟菲斯计算中心异常,并向受到影响的算力合作伙伴致歉。
今年5月,Anthropic宣布与SpaceX签署协议,使用Colossus 1数据中心的全部算力。这使两家服务之间可能存在的基础设施关联,成为值得追查的线索。
不过仍然不能解释为什么三家公司同时出现宕机问题,也无法证实这些故障是否存在共同源头。
猜测还指向Cloudflare和微软Azure。但是,Cloudflare明确否认自身发生重大服务中断;AWS、谷歌云及Azure的状态页,当时也没有显示相关故障。
不过截至北京时间4日凌晨,几家服务陆续恢复。Claude确认影响于00时16分结束;OpenAI于00时55分将事件标记为已解决;Grok随后也恢复正常。
这起事件提示了AI产业的一项结构性风险:模型品牌和算法彼此竞争,底层算力、网络与服务供应商却可能交叉重叠。
对于部署AI的企业而言,采购多个模型,并不能自动确保基础设施风险得到分散。
GPT-6和AGI时代
就在几个AI巨头为宕机事故忙得焦头烂额时,OpenAI正式发布了GPT-6 Astra。
OpenAI的CEO对这个全新模型寄予了厚望,并高调宣布人类已经正式进入了AGI时代。
事实上,如果从数据评测来看,这回OpenAI可能真没有说大话,GPT-6 Astra是一个跨代的模型。
在OpenAI发布的关于GPT-6 Astra的一系列技术成果中,最有分量的无疑是GPT-6 Astra对前沿数学研究的推进。
据OpenAI披露,Astra协助将有界素数间隙的一项上界从240推进至186,即证明存在无穷多对间距不超过186的素数。
此外,它还改进了大素数间隙估计中一个超过80年未变的项。公司同时公开了证明及辅助材料。
这些成果触及了知识生产本身。如果通过进一步的学术检验,AI的贡献将进入数学结论和证明体系,扩大人类能够严格证明的范围。
与之对应,Astra在高难度数学测试FrontierMath Tier 4(v2)上的成绩达到97.6%,上一代GPT-5.6 Sol为83.0%。对于这项测试而言,新模型已经接近满分,现有题目区分顶尖模型能力的空间正在缩小。
更夸张的是,GPT-6 Astra突破了在陌生环境中的自主推理能力。
测试ARC-AGI-3要求智能体进入没有明确规则说明的交互环境,通过探索、反馈和试错,逐步找到解决办法。它考察的是模型面对未知任务时,能否自行建立对环境的理解。
ARC Prize验证的结果显示,Astra在厂商适配运行框架下,最佳成绩约为99.9%;标准框架下则为62.7%。适配框架能够保留跨请求的推理状态,并管理长对话,让模型持续利用已经完成的工作。
这组差异揭示了一项重要变化:模型的推理能力,正在与持续记忆、环境反馈和任务执行系统结合。当这些环节有效协同,智能体就能在更长的过程中积累经验、修正策略,处理此前难以连续完成的任务。
这种自主能力在网络安全领域已经有了深刻影响。
Astra成为OpenAI首个达到其网络安全能力“Critical”门槛的模型。按照官方说明,在具备适当工具和访问权限时,它可以自行发现未知漏洞,并开发利用方式,无须人类逐步指导。官方安全说明
这里涉及的是对复杂系统进行分析、寻找薄弱点,并将发现转化为可执行结果的能力。对防御方而言,这可能加快漏洞发现和修复;同样的自主性,也会显著提高攻击能力被滥用的风险。
OpenAI同时承认,Astra的思维链可监测性有所下降。在要求模型规避监测的对抗性测试中,它能够在部分情境下隐藏异常行为。
尽管整体对齐表现有所改善,单纯检查推理文本,仍可能不足以识别全部风险。
也就是说,目前的前言模型发展已经触及到更深层次的安全和伦理问题。当系统能够自主处理高难度任务,人类需要同时增强对其行为的验证和控制。
数学研究、陌生环境探索、自主漏洞利用,分别对应知识创造、适应能力和现实执行能力。Astra在这些方向上的进展,使人类在AGI上有了更具体、也更值得严肃检验的技术依据。
也许是否达到AGI的程度,不同人有不同的看法。
但是这次OpenAI的新模型显然已经展现了惊人的进展,AI正在深入科研和技术生产中最依赖专家判断的环节。
AI能够承担的工作范围,将影响科学发现的速度、复杂系统的安全,以及人类如何组织下一阶段的技术研发。