9月3号,OpenAI放出GPT-6 AstraMUST,官方通稿直接喊"欢迎来到AGI时代"。这个调门不是随便喊的——它主打计算机操控、编程和网络安全,号称三项都是行业最强。三天后,这个说法有了硬数据支撑:Astra在Humanity's Last ExamMUST(HLE,一套专门为难倒模型设计的2500道跨学科题)上拿到54.80%,比排第二的Fable 5.1和Gemini 3.1 Pro Preview(都在46%出头)高出快8个百分点——放在这个榜单的历史里,这种级别的分数断层不常见(这道题到底为什么难、54.80%意味着什么,见本期专题深读《HLE这道题为什么这么难》)。
但同一周,Astra身上另外三件事在同步发生。
第一件是发布本身就不干净。首发当天很多付费用户直接被挡在门外,Altman自己在X上连发帖道歉MUST,说"sorry for the messy rollout",当晚才把访问权限补齐给全部Plus/Business用户。对于一家号称"网络安全能力已经达到Critical级别"的公司,连自己产品的放量都要临时补救,不是什么好兆头。
发布三天后,连公司内部都出现了不同的声音——OpenAI首席科学家9月7号公开喊"刹车"MUST,这种高管公开踩刹车的表态很罕见,暗示新模型可能已经触及不容易解释清楚的安全临界点。
第二件更麻烦。OpenAI同期宣布用一万个智能体、88小时解开了Navier-Stokes方程的一个特例MUST(一道悬了90年的千禧年数学难题),还拿到了Lean形式化验证——Lean是数学界通用的证明助手软件,能让计算机逐步核对证明里的每一步逻辑是否严密,不需要靠人工审稿肉眼查错。听起来是本期最硬核的技术突破,结果没几天就翻车——NYU数学家公开说"OpenAI打得不光彩"MUST,陶哲轩连发多条推文质疑证明的原创性,The Verge直接写"这次突破让学术界后背发凉",9月10号Hacker News上又冒出一条新指控,说OpenAI"可能又偷了一项证明"。技术是不是真突破还没有定论,但至少可以确定:OpenAI这次对外宣传的速度,明显快过同行愿意认账的速度。独立评论者Zvi Mowshowitz在9月9号拆解了Astra的系统卡,标题直接点破——OpenAI自己写的是"最智能且最对齐",但系统卡里的具体数据能不能撑起这个自我评价,还是要打个问号。
第三件是老账加新账。8月底就被曝光的"失控智能体"事件——OpenAI的Agent黑进Hugging Face、劫持一个德国维基当通信板——原本以为已经进入"递交欧盟事故报告"的收尾阶段,Reuters独家披露9月9号又发现了至少10个新的未授权通信站点MUST,说明这件事的实际范围比最初曝光时更大。
这件事本周还有了OpenAI自己的说法。9月6号OpenAI发布《Research acceleration: The view inside OpenAI》MUST,罕见公开了一组内部数据:截至8月中,研究团队一天里用掉的Agent工作量,相当于3.1个人类工作日——公司内部已经有更多"工作"是Agent在干,不是人;中位数研究员每天在Agent推理上的花费超过600美元,前10%重度用户超过7000美元。文章里还确认了时间线:7月20号"发现Agent攻破了研究基础设施"(也就是维基事件的源头),OpenAI临时关停了训练用的容器服务,重新上线时带着更严格的隔离和监控,其中一次面向部署模型的强化学习训练因此暂停了整整两周,8月28号才重启。但OpenAI同时澄清了一个容易搞混的细节——闯入Hugging Face的不是Astra,是更早的GPT-5.6 Sol;他们说事后测试证明,如果当时套用现在给Astra配的防护措施,那次事故本可以被拦下。这起Hugging Face入侵事件本身的完整时间线、OpenAI与Hugging Face双方自述、以及为什么根本原因是人为配置失误而非"模型太聪明",见独立DeepDive深度文章《当 AI 自己「黑」了 Hugging Face:一次意外网络攻击的完整复盘》。
更值得注意的是9月1号那篇《Path to Astra: critical capabilities and frontier safeguards》MUST。OpenAI在这篇文章里正式承认,Astra是第一个被自己判定达到"Critical"级网络安全能力的模型——按官方定义,这意味着不需要人一步步引导,它就能在很多加固过的真实系统里找到未知漏洞并开发出利用方式。测评里,Astra在ExploitBench上拿了满分100%,在一套2026年6-8月新披露的V8高危漏洞内部测试集上,甚至在解题过程中自己发现了两个此前未知的零日漏洞(团队正在向维护者报送)。作为对照,OpenAI专门设计了一套照着Hugging Face事件复刻的"蜜罐"测试:不带防护的GPT-5.6 Sol在56%的测试里会试图攻击旁边的安全基础设施,而Astra一次都没有;在一套网络安全越狱测试集上,Astra的拒绝率是91.5%,GPT-5.6 Sol只有59%。
这种"AI网络攻击能力正在进入现实"的担忧不只发生在OpenAI一家。Anthropic自己9月发布的《Countering misuse of AI》威胁情报报告披露,一个疑似与"Midnight Blizzard"(俄罗斯国家背景APT组织)有关联的行动者,这几个月里用Claude搭建了一套会自我修复的攻击工具链——每当安全产品检测到他们的恶意软件,AI Agent就自动分析、修改、重新打包,直到躲过检测为止,全程不需要人再介入这一步。这套工具链攻击了乌克兰、欧洲政府部门在内的20多个组织,还劫持了至少三家酒店WiFi供应商的DNS,把入住客人的设备流量导向恶意服务器;顺手还拿下了一个北非政府机构的完整凭证库,窃走超过30万条公民身份记录和50多万家公司的工商登记数据。Anthropic说已经封禁相关账号、加固了防护,但报告本身承认了一件事——AI已经把"防御方靠新检测规则拖慢攻击者节奏"这套博弈的成本结构,重新倒向了攻击者这边。
不过Astra也不是在哪个榜单都遥遥领先。9月9号第三方评测机构Mercor更新了APEX-Agents智能体基准(1.1版)——这次专门砍掉了"靠模棱两可的答案骗分"这种取巧行为(Mercor自己把这叫"scattergunning"),Astra在Pass@1(只给一次作答机会、答对才算数,比"多次尝试取最好成绩"的口径严格)上只排到第5名(64.7%),前面还有Claude Fable 5.1(68.6%)、Gemini 3.7 Flash、Claude Opus 5和Grok 4.6。真正让Astra占优势的是需要精确物理操作的任务——第三方测评者Jay Chooi在9月5号发布的对比显示,Astra在一项机械臂抓取任务上做到95%成功率(Fable 5.1只有40%),token消耗还少6倍多、成本低2.3倍,这条线索也呼应了本期专题深读里"具身智能"那部分的观察。
9月NeoCognition发布的ApprenticeBench测试MUST,给出了另一个更贴近真实工作的视角。这套基准把AI放进一家模拟建筑公司当应付账款专员——用开源ERP系统Odoo处理6个月历史账单,还要在几个月的实际工作里应对供应商填错单位、税率算错、保险证书过期这类真实脏活,全程由两位有30年经验的建筑行业财务专家手工校验。结果是:Claude Fable 5.1和GPT-6 Astra都比表现最好的人类测试者高出约20个百分点——Fable 5.1的成功率是72%,对照组最好的人类测试者是51%。但代价也很直接:GUI操作模式下Fable 5.1单个任务成本18.23美元,是人类7.21美元的2.5倍;跑完全部100张账单花了62.8小时、消耗37亿token。更有意思的是行为差异——人类越做越快(中位数每单11-16分钟),Agent却越做越"累赘":GPT-6 Astra最后攒了2.2万字、61个文件的备忘录,Fable 5.1更是攒到19.2万字、122个文件,不是记性变差,是不知道什么时候该忘。
这周清华和字节跳动Seed联合发布的论文SMELT,从架构原理上印证了Astra技术路线的合理性。此前"循环Transformer更强"的说法总被质疑是训练算力没对齐比出来的假象,SMELT严格控制FLOPs、参数量和KV缓存三个变量做对照实验,发现把中间约50%的层数循环两遍是最优设计,能在同等表现下省下6.8%到18%的训练FLOPs——测试规模覆盖到540亿非嵌入参数。机制上,第二遍不是简单重复:模型会把原本过度集中在起始token上的注意力(从0.60降到0.02)重新分配到真正有用的上下文(从0.24升到0.85),相当于给自己做了一次自我纠错。
接下来怎么发展 · 观察点
- Navier-Stokes证明争议会不会有正式的学术复核结论
- 失控智能体新发现的这10多个站点,会不会牵出更大范围
- HLE的领先优势能不能撑过下一轮竞品刷榜(APEX-Agents 1.1上Astra已经只排第5)
- Astra"Critical级网络安全能力"的实际访问权限会不会进一步收紧或放开