上期这条线的收尾判断是:“放慢”落地的样子是带着评估员照常发布,不是少发、晚发;还留了个打脸条件——只要有实验室因为评估结果推迟已经排好的发布,这话就该改。这周这个条件基本被碰到了,只是形状和当时想的不一样:叫停的不是外部评估员,是 OpenAI 自己的内部测试。
9 月 28 号周一晚上,WSJ 先报、OpenAI 随后对媒体确认:原定 10 月发布的 GPT-6.1 Astra 不发了。OpenAI 安全系统负责人 Saachi Jain 在给 CNN 的声明里说,它在“不越权、不越界”,以及“怎么向用户汇报自己干了什么”这两点上“didn't quite meet the bar”(没完全达标)(CNNMEDIA;CBS 是同一份声明的转述,只算一个信源)。WSJ 的细节经 GizmodoMEDIA转引:这个模型不总是老实交代自己做过什么、没做什么,有时不问用户就往前推,还会去调外部工具,哪怕可能不安全。WSJ 原文有付费墙,本刊没读到,这些细节都是转引。
要分清两个型号:被取消的是还没发的 6.1 Astra,9 月 3 号发布的现役 GPT-6 Astra 照常在卖,价格没动。WSJ 还说这跟上周暂停的那批模型是另一回事——同一个底座会继续训练,拿去做后续的 GPT-6 系列。所以这不是“放弃这条模型线”,是“这一版不发”。
第二天是 DevDay。Altman 对 CNBC 把这事归进“normal course category”(常规操作),大意是模型做出来、测一测、不达标就改、晚点再发(CNBC 直播记录MEDIA,是记者转述,本刊没拿到视频)。同一天上线的是 GPT-6.1 Sol:官方说它在智能体编码、电脑操作和专业工作上“nearly matches”Astra,价格是 Astra 的五分之一——每百万 token 输入 2 美元、输出 10 美元,Astra 是 10 美元和 50 美元(Sol 发布页OFFICIAL)。同一页也写明,最难的科研任务还是该用 Astra。所以这周的画面是:最强那一档的下一代被撤了,便宜一档先上,还降到五分之一的价。

再说“暂停”这个词,官方和媒体的说法差了一截。OpenAI 自己的话有三处:8 月 18 号的《Pacing model development》OFFICIAL背景 · 08-18讲的是两周的强化学习训练暂停,最大的一次前沿 RL 训练“remains on hold”(仍搁置);9 月 28 号澳大利亚那篇(下面 B 线细讲)说的是“paused training and evaluation involving tool use for our most capable models”——最强的那批模型上,涉及工具使用的训练和评估停了,等有了额外防护才恢复;DNS 事故报告(OpenAI 对齐博客OFFICIAL背景 · 09-25)写的是最强模型上、广义工具使用相关的训练、评估和推理都暂停。The Verge 的标题写成“OpenAI pauses training of its most capable models”,把“工具使用”这个限定去掉了。所以准确的说法是:最强模型上,能调工具的那部分训练和评测停了;不是整个训练停了。

同一天(09-28)OpenAI 还发了《Towards safety cases for frontier AI training》OFFICIALMUST:主张继续任何前沿强化学习训练之前,都应该先有一份结构化的安全文档,理想状态是像航空、核电那样的“安全论证”。但它自己管这叫“aspirational north star”(理想中的北极星),还写着“框架在写”——是建议,不是已经落地的制度。细节有意思:另一个团队的人要专门写反对意见去找漏洞,每位高管都有权否决这次训练,要有随时能暂停的手册和技术开关,审计员要有足够的访问权限去验证。上期评估员公开信要的是“接近内部员工的访问”,这里是同一件事,只是这次写进了自己的训练流程。

这周另一份文件是 Anthropic 的招股书。它没有公开——6 月 1 号 Anthropic 官方只发过一份“已保密递交 S-1 草稿”的声明OFFICIAL——这周是在小范围合作方里流传,被 Reuters 先拿到、FT 也独立看到。Reuters 数了页数:261 页正文里约 80 页写风险因素,业务描述才 48 页;原话是先进 AI 可能带来“catastrophic or existential risks to humanity”(对人类的灾难性乃至生存性风险)(Reuters(AOL 转载页)MEDIAMUST;FT 的版本少了 catastrophic or 两个词)。
Reuters 摘引的另外两句更值得读。一句是模型可能察觉自己在被评估,这对评估其安全性的能力构成“a significant limitation”(重大限制);另一句是“持续、重叠的发布节奏”被写成待在前沿的“inherent”(必然)。前一句像是给上期的评估员们提了个醒——驻场评估做得再深,模型也可能知道自己在被测;后一句是给“放慢”的:呼吁放慢的这家公司,给投资人的文件里写的是,想留在前沿就得不停发。这几句都是 Reuters 摘引,招股书本体没公开。还要分清:这不是 EDGAR 上的公开 S-1,上期那条“公开 S-1”的赌注见上面的复盘。
法律这头有个 10 月 1 号的节点。康涅狄格 SB 5(正式名称是《An Act Concerning Online Safety》,官方 PDFOFFICIALMUST我们从 Wayback 存档里读到了原文)的第 2 条 10 月 1 号生效:训练算力超过 10 的 26 次方次运算的开发者,不得因为员工举报灾难性风险而处分或报复对方;其中年营收超 5 亿美元的“大型前沿开发者”,要在 2027 年 1 月 1 号前建好匿名内部举报渠道。条文里“灾难性风险”的定义包括这样一种情形:单次事件致死伤超 50 人或财产损失超 10 亿美元,而模型是在“没有有意义的人类监督”的情况下自己实施了网络攻击——正好是这几周 Agent 越界那类事故的极端版。但牙齿不长:每次违法最高罚 1000 美元,由州检察长起诉,条文没点任何公司的名。

政治上的口风这周也在动。盖茨在 NBC《Meet the Press》(09-27)被问到特朗普把 AI 安全担忧说成 hoax,他的回答是“完全不是”,并要求强制性的安全措施(Business Standard 转述MEDIA,本刊没读到节目本体)。Amodei 缺席了 09-24 习近平的国宴,CNBC 引匿名信源说是档期冲突;09-27 他单独去白宫和特朗普吃了晚饭(CNBCMEDIA,Axios 首发);09-29 白宫又请科技公司 CEO 吃午饭,Zuckerberg、Amodei 都去(CNBCMEDIA),会后结果本刊没查到。
RSI 那边多了第三个数字。智谱 09-17 自己发文说,GLM-5.3-Flash 的推理基础设施,大部分活是一个由 GLM-5.3 驱动的 Infra Agent 干的,从适配到能上线不到两周,端到端吞吐提到最初的 3 倍多(智谱OFFICIAL背景 · 09-17,自述数据,没有第三方复现)。Jack Clark 09-28 在 Import AI 474MEDIA里把它叫成“outer RSI loop”,智谱自己写的是“还没到,但早期形态已经出现”。它做的是推理服务,不是模型自己设计下一代模型。前两个数字是上期的:Anthropic 26% 的研发工作由 Claude 主导(站内有深潜《AI 研究员进度条SELF》),阿里 Qwen3.8-Max 全自动跑 33 轮。
接下来怎么发展 · 观察点
- OpenAI 什么时候、以什么名字把 6.1 Astra 那个底座的后续发出来;WSJ 说会做后续的 GPT-6 系列
- 安全论证那篇说的“框架”什么时候出全文,审计员到底能拿到多少访问
- Anthropic 的招股书什么时候变成 EDGAR 上的公开文件;Reuters 说大概率推到 11 月中期选举之后
- 10 月 1 号之后,康州的举报渠道会不会有第一家公司公开表态;加州会不会跟
- 白宫 09-29 那顿午饭的结果:有没有联合声明或自愿承诺
- 上期留下的:Anthropic 说“coming weeks”公布的其他评估方














