上期这条线停在一句话上:减速论减的是别人的速度。这周它从嘴上落到了三样东西上——一份合同、一道行政令、一张价格表。先说合同。9 月 18 号 Anthropic 宣布了第一家驻场评估方:埃森哲MUST,具体由埃森哲今年 1 月收购的 AI 部门 Faculty 牵头,工作是评估和红队测试模型、做对齐评估、测安全防护。条件写得很具体:驻场评估员"will work inside AI companies, with access comparable to an employee's"(在 AI 公司内部工作,访问权限接近员工);"Anthropic and Accenture each expect to invest at least $1 billion in building capacity in this area over the next five years"(双方预计未来五年各自在这方面至少投 10 亿美元)。最值得停下来读的是这一句:"Given the importance and urgency of this work, Anthropic will fund Accenture's work directly."(鉴于这项工作重要又紧迫,埃森哲的评估由 Anthropic 直接出钱。)紧接着它自己也承认这不是理想安排:"Long-term, we think funding should come from pooled or government sources… As neither exists today, we plan to work with different evaluators under different funding arrangements."(长期看经费应该来自共同基金或政府,这两样现在都不存在,所以只能和不同评估方谈不同的资金安排。)合作不排他,"other evaluators to be announced in the coming weeks"(其他评估方未来几周公布)。埃森哲股价当天盘后涨了 8%(TechCrunch)。驻场评估员是什么Amodei 9 月 12 号长文里"三步走"的第一步:让外部机构的人坐进实验室,拿接近员工的权限,在模型训练和发布前就能看、能测、能提意见,而不是等发布后拿个 API 从外面测。上期的问题是"谁来当、谁付钱",这周第一个答案出来了。
同一天,另一份文件把尺子摆在了旁边。AI Evaluator Forum 发了一封公开信《Minimum Conditions for Embedding Evaluators》MUST,列了驻场评估的五条最低条件,截至 9 月 23 号签名已过 200 人,Hinton、Stuart Russell 都在里面(发布当天 CNBC 独家报的是"100 多位")。第一条就是独立性:"embedded evaluation organizations should not be owned or governed by frontier AI companies, should not have other significant commercial business with them, and should not accept any form of payment or other reward contingent on the evaluator's findings."(驻场评估机构不应被前沿公司拥有或治理,不应与其有其他重大商业往来,报酬不得与评估结论挂钩。)Nathan Lambert 签了名,他点出的难处很实在:"one of the biggest bottlenecks is finding people with the technical capabilities and that high bar of independence"(最大的瓶颈之一,是找到技术过硬、又够独立的人)。把两份文件放在一起读就尴尬了:据 TNW 报道,埃森哲本来就是 Anthropic 最大的 Claude Code 企业客户——第一单合同,碰上了同一天发布的最低条件第一条。这不代表埃森哲测不好,但"被评估方付钱、评估方同时是大客户"这个结构,正是那封信想排除的。
还是 9 月 18 号,加州州长 Newsom 签了行政令 N-9-26MUST,把"驻场评估"往法律上推了一步。行政令原文要求州政府在 11 月 16 号前拿出修法建议,至少四项:前沿开发商必须在实验室驻场指定的独立核查机构("embed designated independent verification organizations onsite in their labs");安全报告要经独立核查;前沿模型必须有"kill switch"(紧急关停开关),而且开关有没有用要由核查机构持续验证;把失控类事件写进必须上报的"关键安全事件"。Newsom 的原话是"We're not waiting to act"(我们不等了)。要说准的一点:这还是"研究后提建议",不是马上生效的强制要求——但它把 Amodei 的自愿方案,变成了一个州政府写进公文的时间表。
OpenAI 这周交的是两篇文章,没有名字。9 月 21 号的《Building standards for the next phase of AI》主张由美国牵头、和各国一起定前沿 AI 的全球技术标准,"including for RSI"(包括递归自我改进),同时划清边界:"These technical standards would not be licenses, mandatory prerelease review, or approval requirements for AI models."(这些标准不是许可证,不是强制发布前审查,也不是审批要求。)文中有一句很直白:"Fully autonomous RSI is not happening today, and we should not pursue it unless and until it can be done safely."(完全自主的 RSI 今天还没有发生,在能安全做到之前不应追求。)它还特意提了中美:"upcoming talks are happening at an opportune time"(即将举行的会谈正逢其时)。第二天的《Priorities and principles for effective third party assessments》MUST列了四个优先领域和七条原则,访问方式写的是"access on company-managed devices or premises may be appropriate"(在公司管理的设备或场所里访问可能是合适的)——比 Altman 9 月 12 号说的"desks, access badges, company laptops"收了半步——至于评估方是谁,只有一句"We are in conversation with multiple third parties"(我们在和多家第三方谈)。
反垄断这头,发牌人这周开口了,但没人去领牌。司法部三号人物、分管反垄断的副司法部长 Stanley Woodward 9 月 17 号在 Fordham 反垄断年会上说"It doesn't occur to me that coordinating on cybersecurity or security is anticompetitive"(我不认为在网络安全或安全问题上协作是反竞争的)(Washington Examiner背景 · 09-17);9 月 21 号他对 Bloomberg 补了一句:"That meeting hasn't been requested."(还没人来约这个会。)(Insurance Journal 转载)上期说实验室想要反垄断豁免,结果司法部说可以谈、却没人上门。先上门的反而是律师:9 月 18 号,一批付费订阅用户在加州北区联邦法院提起集体诉讼 Buist et al. v. Anthropic PBC et al.,被告是 Anthropic、OpenAI、SpaceXAI 和 Google,理由是约定"比竞争条件下更慢"地推进,"has an anticompetitive effect on consumers"(对消费者有反竞争效果)(CNN)。Musk 的回应就一句:"Damned if you do, damned if you don't"(做也挨骂,不做也挨骂)(X)。
然后是价格表。9 月 22 号 Anthropic 发了Claude Opus 5.5MUST,开头就交代:"Claude Opus 5.5 is our first release since we called for pacing the frontier. It was tested before release by external evaluators, including Frontier Design and METR."(这是我们呼吁放缓节奏之后的第一次发布,发布前由 Frontier Design、METR 等外部评估方测过。)性能是"at the level of Claude Fable 5.1 on most work"(多数工作上达到 Fable 5.1 水平);价格从 Opus 5 的每百万 token 输入 5 美元、输出 25 美元降到 4 美元和 20 美元,标价降 20%,官方说典型工作负载总成本降 40%(缓存读取降得最多,60%)。安全部分有两个细节:试图越过隔离边界的频率比 Opus 5 低约 85%;以及"We see signs that Opus 5.5 often suspects it is being evaluated"(有迹象表明 Opus 5.5 常常怀疑自己在被评估)。METR 自己的评估报告同日发出,结论是"a modest improvement upon Fable 5.1"(比 Fable 5.1 有小幅提升),"unlikely to be able to fully automate AI R&D"(不太可能完全自动化 AI 研发);报告里还引了 Anthropic 内部初步报告的估计:"~1.5X overall acceleration in capabilities due to AI"(AI 让能力进展整体加速约 1.5 倍)。
同一天,OpenAI 发了 GPT-6 Sol 和 Luna,价格直接对半:Sol 从 4 美元/20 美元降到 2 美元/10 美元,Luna 从 0.20/1.20 降到 0.10/0.50——要注意它的对比基准是"their GPT‑5.6 promotional pricing"(GPT-5.6 的促销价)。在 AutomationBench 上,xhigh 档的 Sol 分数超过 max 档的 Opus 5,每任务成本只有后者的 9%。发布页没有单独的 system card,链接指向的是 GPT-6 Astra 那份,也没提外部评估方。CNBC 的标题替所有人说了:"first release since call for slowdown"。说白了,"放慢"之后的第一个动作,是两家同一天发新模型、同一天降价。成本下限为什么一路往下掉,站内深潜《推理成本的下限正在消失》拆过供给侧的几个推手。
这周关于"AI 自己研发 AI"的三个说法放在一起看更有意思。Anthropic 9 月 17 号发了R&D Automation IndexMUST背景 · 09-17:截至 8 月,Claude 在 Anthropic 26% 的研发工作里处于"leads"(主导)级别——3 月是 1%,5 月 12%,7 月 22%;超过 90% 的工作至少到了"AI collaborates";没有任何一类是完全自主。常用平台上同时跑着约 3 万个 agent,8 月分析的 10 亿多次决策里约 1/47,000 被在线监控拦下;某一周的研发算力里约 6% 用在安全上。方法上的限制它也写了:打分用的是 Claude 当裁判,模型和人的完全一致率 59%,人和人之间只有 35%。同一周 OpenAI 说完全自主的 RSI"not happening today";阿里 9 月 22 号在云栖大会的官方稿里则说 Qwen3.8-Max"Over a month of fully automated runs… completed 33 iterative cycles"(一个多月全自动运行,完成 33 轮迭代),Artificial Analysis 分数从 40 升到 45(阿里自报,没找到第三方确认)。三家公司,三种说法,没有一家在说"我们停了"。
政府这边口风没变,只是更直白了。特朗普 9 月 19 号在 Truth Social 上宣布组建"AI Force"——"much like I did Space Force"(就像我第一任期建太空军那样)——并说"We will not in any way hinder or stifle the Growth of this incredible Industry"(我们绝不会阻碍或扼杀这个了不起的行业的增长),坏事交给"already existing Criminal and Civil Justice System"(现有的刑事和民事司法体系)处理(CNN)。9 月 22 号联大讲台上他更进一步:"We will only encourage superintelligence. We're going to encourage it, not rein it in."(我们只会鼓励超级智能,不会约束它。)还说美国"totally rejects any attempt to construct a globalist scheme to control for the artificial intelligence"(完全拒绝任何构建"全球主义方案"来管控 AI 的企图)(CNBC)。贝森特在众议院听证会上说"the president is completely aligned with Jensen Huang"(总统和黄仁勋完全一致)(CNBC)。民意在另一边:Reuters/Ipsos 9 月 22 号的调查里 73% 的人担心 AI 公司防范严重危害做得不够,55% 认为放慢开发是好事,只有 13% 认为是坏事。联合国安理会 9 月 23 号(纽约时间下午)第一次专门开会讨论前沿 AI 安全,Altman 现场、Amodei 远程、Bengio 和 Delangue 作简报(Security Council Report)——截至发稿还没开,发言原话等周五补。
反对声这周也更响。吴恩达 9 月 21 号在 X 上长帖说这轮恐慌"propelled by what appears to be a well orchestrated PR campaign"(似乎是由一场精心策划的公关活动推动的),"I don't see any step up in the risk of human extinction from AI compared to a few months ago"(和几个月前比,我看不出 AI 导致人类灭绝的风险有任何上升)。Lambert 在 Interconnects 上写得更短:"The step from this anxiety… to extinction risks feels very religious."(从这种焦虑一步跳到灭绝风险,感觉很像宗教。)中国这边,华为徐直军 9 月 17 号对 Reuters 说的角度很特别:"maybe AI model providers in China may need to speed up their pace to the level that they could also feel the risks from AI development"(中国模型厂商也许需要加快,快到自己也能感受到 AI 发展的风险)(Reuters 转载背景 · 09-17)。RAND 9 月 15 号的《Maintaining Freedom of Action》背景 · 09-15把超级智能战略分成共存、阻止、加速三大类七种原型,Jack Clark 在 Import AI 里的点评是:"it feels like the US strategy can mostly be described as the 'acceleration' one"(美国现在的做法基本就是其中的"加速"路线)。
接下来怎么发展 · 观察点
- Anthropic 说"coming weeks"公布其他评估方——第二家是不是非营利(METR、Redwood),资金是不是它自己出
- OpenAI 那句"in conversation with multiple third parties"什么时候变成名字;Google 至今没有任何表态
- Buist 集体诉讼会不会有第二起跟进;司法部那句"没人来约会"会不会变成一次正式会面
- 联合国安理会 9 月 23 号的发言原话,以及习近平访美的联合成果里有没有 AI 一段(见上期看点复盘)
- Newsom 行政令 11 月 16 号的修法建议里,"kill switch"会写到多具体
















