故事线 A · 本轮从推演升级为结论
账单到期:读数落地——中国大厂的报表第一次承认了 AI 的账,而挤压出现在收入下滑的同一季度
横跨:市场信号 🔥 / AI基础设施 🔥 / 观点洞察与事件 🔥 / 潜信号 🔥 / 应用 / 技术栈 / 交互界面 — 7 格,跨 5 层
- 需求端早就不买最贵的了 —— Tom Tunguz《Honestly, Who Buys SOTA?》(08-14):OpenRouter 上 84% 的 token 不是 SOTA;六个主力模型交付约 77% 的前沿性能、价格是 Claude Fable 5 的 2.5%。⭐ 本轮补入判定标准与价差量级(据 08-21 分享会现场讲述):「非 SOTA」在这里有明确定义——能力低于当前 SOTA 90% 的模型即算非 SOTA,也就是说,开源模型哪怕拿到 95 分也仍算 SOTA 阵营,84% 这个比例是在这个偏严的口径下得出的。价差侧:非 SOTA 模型百万 token 约 0.5 美元,Fable 5 约 20 美元——40 倍(现场口述为「接近 50 倍」,按 20÷0.5 实为 40 倍,此处取算术值)。而那 6 个吃掉 OpenRouter 81% 流量的模型里没有一个是最强模型,当周前三为 DeepSeek V4 Flash、混元三、小米 Mi Model V2.5。
- ⭐⭐ 本轮新增·而「谁在花钱」这一侧第一次有了分层数字,分化程度超出预期 —— 据 08-21 分享会引用的美国企业数据:每员工每月 AI 支出,排名前 1% 的企业中位数已达 7,400 美元,前 10% 为 650 美元,而普通企业只有 12 美元。 12 美元连一份 20 美元的个人订阅都不到——三条线放进同一张图,最下面那条基本是贴地的。这组数字把「AI 支出在涨」这个笼统印象拆开了:涨的是头部那一小撮,中位数企业几乎没动。跨平台印证来自企业支付公司 Ramp(做企业信用卡与报销,因此沉淀了大量真实付费数据,口径比 OpenRouter 更全,因为它能覆盖直接从一方采购的企业):当前这波支出增长主要来自 Anthropic,增速最猛的其实是 xAI,OpenAI 的占比甚至在下降,Google 长期走平。Ramp 同时给出一个警示——企业在 AI 上的支出可能已经触及上限。另一个反直觉的细节:在 Anthropic 内部的型号结构里,最大头仍是 Opus 4.5/4.8,刚发布的 Opus 5 已超过 Fable 5,而 Sonnet 5 的占比没有想象中高。
- ⭐ 本轮新增·于是「最强模型」的商业效应第一次被量化为递减 —— 同一份数据显示:Fable 5 虽贵,但它在企业总支出里只占约 11%。现场给出的解读是,钱正从「买最强的模型」转向「买部署、买 harness、买 agent 那一层」。据此给出的选型方法论是本条最可直接执行的部分:不要挑智能指数图右上角那个点,要挑那条包络线上的模型——也就是智能水平与成本的帕累托前沿,并且要意识到厂商发布会上给你看的帕累托前沿图往往只是全集里的一个有限子集。⭐ 补记:此处上一版写「Fable 5 只占企业总 token 的 6% 一说仅见于 AI 摘要、不予采用」,该判断已被推翻——对分享视频重新做完整转录后,找到了原话:「Fable 5 这种买的 token 那样只占 6%,但是它占了企业总支出的 11%,基本就是又贵又贵的。」故 6% / 11% 两个数字均成立,此前对不上只是因为手工整理的那版逐字稿有损。
- 于是闭源前沿被迫降价 —— OpenAI 将 GPT-5.6 Luna 砍价约 80%、Anthropic Opus 5 定价约为 Fable 5 一半(08-14)。
- 但同一周中国模型反向涨价,理由是产能 —— DeepSeek V4 新价格 08-16 16:00 UTC 生效,部分负载涨幅达 1,100%,首次引入峰谷分时。
- 上游确实在全线涨 —— SMIC 晶圆均价 +5.7%,三季度还要再涨;美国部分地区天然气价格未来几年或翻三倍。
- 成本穿透到宏观 —— AI「Chipflation」进入英国 7 月 CPI,预计加速至 2.9%(08-15,Business Standard 独立口径)。
名词 · Chipflation 芯片通胀
定义(原文):「In simple terms, chipflation is when memory chips stop getting cheaper over time, and become more expensive and even harder to find.」
直译:简单说,chipflation 就是内存芯片不再随时间变便宜,反而越来越贵、越来越难买到。
为什么这个定义值得逐字记:它否定的是一条被默认了半个世纪的前提。整个数字产业的成本模型都建立在「同样的存储,明年更便宜」之上——chipflation 说的不是「涨价了」这种周期波动,而是这条向下的曲线本身被掰转了方向。一旦成立,所有按「硬件年年降价」做的多年期预算、定价与毛利模型都要重做。
出处与归属需要说清楚:这段定义出自 世界经济论坛《Chipflation: What to know about "AI's hidden price tag"》,但文章明确写道「That definition is from Morgan Stanley」——真正的定义方是摩根士丹利,WEF 是转述方。
该文给出的三个成因:① AI 数据中心投资——大厂采购量超出行业可轻易供给的规模;② 建厂周期太长——新建并跑通晶圆厂要数年,形成短期无法疏通的供给瓶颈;③ 供应链受限——地缘紧张、出口管制与供应链碎片化持续推高生产成本。摩根士丹利的量化口径是:内存价格在过去一年上涨约六倍,原因是厂商把产能优先给了毛利更高的数据中心芯片而非日常设备用芯片;其警告原文为「始于 AI 基础设施瓶颈的问题,如今正在扩散进硬件毛利、设备可负担性、云成本、通胀与政策」。
需求侧的传导证据来自另一份独立信源——ISI Markets / CEIC《AI-driven "chipflation" is feeding into consumer electronics prices》(Ana Cuello Franco,07-24)。它的开篇判断与摩根士丹利的定义完全独立却完全一致:「几十年来消费电子一直在变便宜,而 AI 超级周期可能已经通过 chipflation 终结了这个现象。」传导链条被讲得更具体:数据中心建设正在挤出传统消费端市场——存储大厂把产能优先给高毛利的 AI/服务器产品,而不是 PC、智能手机与白色家电用的半导体,结果 AI 级与消费级芯片价格同时上涨,美国这些品类的进口成本与 CPI 因此快速走高。
而这条线里最重的一句话在这里:美联储已经注意到了。该文写道,美联储在其(发稿时)最近一次会议纪要中指出,AI 基础设施可能会对通胀构成持续的上行压力——科技产品与电力成本同时变贵。 这把 chipflation 从「行业成本问题」推到了「货币政策已在正式文件里讨论的变量」,是本条故事线所有证据里级别最高的一条。企业调查侧的佐证是:计算机与电子制造商已属于最可能报告投入成本上升的行业之一,而制造业内部正在按「是否直接需要芯片作投入」分化,两类企业之间的差距在扩大。
⚠️ 两篇均超窗,仅作名词定义与背景引用,不计入窗口内条目数:WEF 那篇发布于 08-05(早于窗口 9 天),ISI Markets 那篇发布于 07-24(早于窗口约 3 周)。之所以仍然收进来,是因为三条彼此独立的证据链在这里合上了:① 价格幅度——「过去 12 个月上涨 500%」(Tom's Hardware)与「过去一年约六倍」(摩根士丹利)说的是同一件事,来自完全不同的信源;② 宏观穿透——英国 7 月 CPI(本条上方,08-15,在窗口内)与美国进口成本/CPI(ISI Markets)分属两个经济体;③ 政策确认——美联储会议纪要。本条故事线此前只能说「成本正在穿透到宏观」,现在可以说的是:两个经济体的物价数据已经记到了它,而至少一家央行已经把它写进了纪要。另有两处坐标值得留在这里:苹果 CEO 库克把这轮内存涨价称为「百年一遇的洪水」,称入行四十年没见过;分析师预计供给紧张将持续到本十年后半段。历史对照是疫情期缺芯——当时导致汽车产线停摆、PS5 二级市场价格翻倍,但那一轮是需求冲击后的恢复问题,这一轮的买方是不会停的资本开支。
- ⭐ 本轮新增·并且落到了消费级价签上 —— 内存价格 12 个月上涨 500%,128GB DDR5 报 3,399 美元、最高达历史最低价的 10 倍(08-17)。上周它还只是 CPI 里的一个分项,本周有了具体价签。
- 涨价打击的不是单价,是一整套架构假设 —— DeepSeek V4 Demand is Stress-Testing the Economics of Coding Agents(08-17):涨幅最大的是 V4-Pro 的 cache-hit,「反复重放稳定前缀省钱」这套设计的相对折扣被显著压缩。两家编程 agent 平台已公开喊价找算力(Command Code 称有 12 万亿 token 负载在找供应商)。
- 于是价格波动本身被资本化 —— Stripe 敲定以 70 亿美元以上收购 OpenRouter(08-16),较三个月前 B 轮 13 亿估值跳升逾 5 倍,且恰好发生在 DeepSeek 涨价生效当天(开发者侧反应汇总)。
- ⭐⭐⭐ 本轮新增·而交易在三天后由被收购方自己官宣了 —— OpenRouter is joining Stripe(官方公告)(08-19,CNBC / a16z 同日)。上一版这条写的是「在正式公告前它是一条强信号而非既成事实」——现在它是既成事实了。关键运营数字同期披露:年化收入 1.4 亿美元、年化毛利约 1 亿(毛利率约 70%);月处理 token 量从 2 月的 50 万亿涨到 250 万亿——五个月五倍。这是「价格波动值 70 亿」的量化依据。
- ⭐ 本轮新增·而买方也在向上游延伸股权 —— Marvell 给予 Google 以 122 亿美元入股其定制 AI 芯片业务的选择权(08-19)。与 Nvidia 从卖芯片转向持有电厂与园区是同一动作的镜像:在算力紧缺期,芯片的交易形态正在从「采购」变成「股权与授信」。
- ⭐ 本轮新增·而电力这条约束出现了第二条路线 —— TerraPower 的核反应堆给 AI 数据中心供电藏着一件秘密武器(08-19)。与 Nvidia 自建 9.2 GW 天然气电厂并读:选气建得快但暴露在燃料价格波动里,选核建得慢但建成后成本近乎固定——这个选择会决定未来十年的成本曲线形状。
- ⭐ 本轮新增·而上市窗口第一次被排出了先后 —— OpenAI CFO Sarah Friar 称 IPO 时点指向 2027 年(08-19),而 Anthropic 预计最快今秋先行、寻求 2 万亿以上估值。先上市的那家将成为整个「AI 变现层」的公开市场定价锚。
- ⭐ 本轮新增·清算层的争夺立刻出现第二个玩家和第一批模仿者 —— Amazon/Walmart 的信用卡发行商 Synchrony 与 OpenAI 合作,把支付接入 ChatGPT 购物(08-17);Launch HN: Speko —— 「语音 AI 界的 OpenRouter」(08-17)。一笔收购把一个产品品类变成了可复用的融资模板。
- 卖铲人一边收缩担保、一边改持真实资产 —— Nvidia 把 OpenAI 俄亥俄担保从 2,500 亿下调至不足 1,200 亿(08-14);三天后向 SB Energy 投资 15 亿、提供最高 1,050 亿授信、拿下 PORTS-Pike 独家算力供应权(08-17,配套 9.2 GW 天然气电厂、造价约 330 亿)。定性佐证:Nvidia 的护城河正从芯片转向资本。
- ⭐ 本轮新增·「自研芯片打破算力垄断」这条路多了一个失败样本 —— Groq 融资 3.5 亿,估值 35 亿、较去年 9 月的 69 亿腰斩,彻底从自研 LPU 改成运营 Nvidia 系统的 neocloud(08-17)。背景是 Nvidia 曾以 200 亿美元授权交易挖走其创始人兼 CEO。一家曾经的挑战者,现在拿 Nvidia 的钱买 Nvidia 的卡去卖 Nvidia 的算力。
- ⭐⭐ 本轮新增·账单终于到期:读数公式在中国大厂报表上落地 —— 百度 Q2 2026 财报(08-18):AI Cloud Infra 收入 RMB 73 亿 / +50%(GPU Cloud +283%),同期资本开支 RMB 113.9 亿 / +200%,比值 0.25——资本开支增速是 AI 云收入增速的 4 倍;自由现金流 −RMB 79.5 亿;总营收 −4%、归母净利 −68%。而最关键的一个数字前瞻稿全部漏掉了:AI Cloud Infra 环比 −17%(Q1 88 亿 → Q2 73 亿)(InfotechLead 第三方交叉)。
- ⭐⭐⭐ 本轮新增·第二个中国样本落地,读数 0.60 —— 阿里 6 月季财报(官方业绩演示,08-20):AI Cloud and Compute Services 收入 RMB 484.37 亿、增速加速至 +45%;同期资本开支 RMB 676.78 亿、同比 +75%;→ 45% ÷ 75% = 0.60。自由现金流 −RMB 446.70 亿(去年同期 −188.15 亿,恶化 2.4 倍),净现金头寸单季少 528 亿;总营收 +9%。AI 相关产品收入 RMB 123.76 亿,连续第 12 个季度三位数增长,占外部云收入 35%。
- ⭐⭐⭐ 而这份财报最重要的不是比值,是官方给出的资本开支归因 —— 同一份文件把 +75% 拆成三条:① 采购周期波动;② 「CPU 算力扩容,由预期中的 AI agent 客户采用增长驱动」;③ 「广泛芯片零部件价格上涨」。这两条正是本条故事线此前只能靠外部推演的判断——我们从 AWS 下令省 CPU 周期 推出「先到极限的可能是 CPU 侧」,从 英国 7 月 CPI 推出 chipflation;现在一家中国大厂在财报里把资本开支超支同时归因于这两件事。
- ⭐ 本轮新增·央行第一次下场定调 —— 欧洲央行经济学家警告 AI 正驱动一场逼近的市场回调(08-18):论证结构是「即使 AI 的变革力是真的,历史规律也预示估值将回落」。同日 一位交易员以 1.29 亿美元做空半导体 ETF。
- ⭐ 本轮新增·但产业链另一段的钱正以 7 倍速增长 —— Anthropic ARR 于 7 月底突破 650 亿美元(08-17,CNBC 独立口径):5 月为 470 亿、去年底仅 90 亿;对照 OpenAI 上周披露 ARR 400 亿。同一周里:卖模型的一年涨 7 倍,买卡建云的资本开支增速是收入增速的 4 倍。
- 补贴换规模的策略同期进入第一次结算 —— Perplexity 印度免费策略:7 个月累计下载 5,600 万,本月最早一批免费期到期、需主动取消才不扣费(08-18)。
- 而最不追风口的机构在同期加仓 —— 伯克希尔增持 Alphabet 170 亿美元(08-15)。
一句话主张
两个中国样本都出来了:百度 0.25,阿里 0.60。都跑不赢,但差了一倍多——而这个差距恰恰是本期最有价值的信息。差异不来自 AI 业务本身(阿里 AI 云增速 45% 甚至低于百度的 50%),来自主业还能不能造血:百度总营收 −4%、净利 −68%,阿里总营收 +9%。所以正确的判断不是「中国 AI 云不赚钱」,而是:AI 资本开支的挤压对所有人一视同仁,能不能扛住取决于你的存量业务。这把上一版「结构性错配」的判断精确化了一层——错配确实存在(投入增速普遍是收入增速的 1.7–4 倍),但它是否致命,由报表的另一半决定。
而本轮真正的确证来自阿里对资本开支的官方归因。它把 +75% 拆成三条,其中两条是:「CPU 算力扩容,由预期中的 AI agent 客户采用增长驱动」、「广泛芯片零部件价格上涨」。这两件事我们前两周只能从 AWS 内部指令和英国 CPI 里侧面推出来,现在有了财报级的一手确认。含义比听上去大:它说明 agent 化不只是软件范式变化,它在改变数据中心的采购结构——扩的是 CPU 而不只是 GPU。所有把「算力紧张」等同于「GPU 紧张」的容量规划和投资模型,都需要加一个维度。
判断泡沫的指标本期定为四个:① 表外兜底规模;② 电子品类 CPI(已落到 128GB DDR5 报价 3,399 美元);③ CPU 侧产能队列(本轮由阿里财报确证为真实约束,不再是推演);④ 大厂 AI 云收入的环比方向——百度已经出现「资本开支环比 +92% 而 AI 云收入环比 −17%」这种反向组合,这是目前最早的裂缝形态。
必须同时说清楚的反面:① 两个样本仍不足以推及全行业——腾讯、字节、华为云口径都不同,且阿里本季刚做过分部重组(AI Cloud 合并了 T-Head),同比口径的可比性需要打个折;② 产业链另一段的钱在爆发式增长——Anthropic ARR 一年涨 7 倍,说明「AI 赚不到钱」是错误命题,正确命题是「AI 的钱不在建云的那一段」;③ 伯克希尔同周加仓 Alphabet 170 亿。三条合起来指向同一个精确结论:风险高度集中在为算力融资和建设的那一段,而不是整个 AI。
为什么这条线值得连起来看(90 秒):前三期我们一直在推演一个公式:AI 云收入增速 ÷ 资本开支增速。本周它有答案了,是 0.25。但真正让这条线变得锋利的不是这个比值,是藏在财报里、所有前瞻稿都漏掉的那个环比数字——在资本开支环比接近翻倍的同一个季度,AI 云收入环比下滑了 17%。把它和 GPU Cloud 仍在 +283% 加速放在一起,画面就清楚了:紧俏的部分极度紧俏,其余部分在萎缩,而钱是按总量投的。这解释了为什么同一周里会出现三件表面矛盾的事:欧洲央行警告估值回调、一位交易员花 1.29 亿做空芯片、伯克希尔加仓 170 亿——他们赌的不是同一件事,做空的是卖算力的那一段,做多的是用算力赚钱的那一段。Anthropic 的 650 亿 ARR 正好落在后者:一年涨 7 倍。而 Nvidia 的动作是这条线上最诚实的信号——三天之内,先把替客户担保的 2,500 亿砍到 1,200 亿以下,再掏 15 亿直接持有电厂和园区。或有负债往下,自有资产往上,方向不含糊。Groq 则给出了反面的注脚:最被看好的挑战者,最后是拿 Nvidia 的钱买 Nvidia 的卡去卖 Nvidia 的算力——「未来会有便宜替代芯片」这个假设,本周又少了一个支撑。最后是普通人这一端:128GB DDR5 报价 3,399 美元。从数据中心抢内存到英国 CPI,再到你换电脑的账单,这条传导链本周三个环节全部拿到了具体数字。
接下来怎么发展 · 观察点
- ~~8/20 阿里 6 月季财报~~ ✅ 已落地,读数 0.60(详见时间线第 13–14 条)。下一个观察点顺延为:腾讯 / 字节 / 华为云是否给出同口径读数——两个样本只能说明「挤压普遍存在」,三个以上才能判断这是不是行业形态。另注意阿里本季刚做过分部重组(AI Cloud 合并 T-Head),同比口径可比性需打折,下季度才有干净的连续读数。
- 下季度大厂 AI 云收入的环比方向:本期新增的第四个泡沫指标。环比转负 + 资本开支环比翻倍,是最早的裂缝形态。
- DeepSeek 涨价后的迁移潮观测窗 08-19 ~ 08-23(本周正在窗口内):① OpenRouter 上 DeepSeek 份额是否可见下滑;② 峰谷定价是否真把负载推向离峰时段;③ 是否因反弹回调。注意:Stripe 收购一旦落定,指标 ① 的中立性本身要打问号。
- 英国 8 月 CPI(9 月中)中电子品类是否继续走高,以及美联储下一份纪要是否再次点名 AI 基础设施:这是 chipflation 究竟是一次性冲击还是持续通胀源的两个可证伪读数,而后者的级别更高——一次点名可以是观察,连续两次就是政策变量。供给侧已经给出了它的预期答案——摩根士丹利与多家分析机构判断内存紧张将持续到本十年后半段,而新建晶圆厂的周期决定了短期无解。所以这个读数真正要检验的不是「会不会涨」,而是「涨价能不能穿透到一般消费品价格并稳定留在 CPI 里」——若 8 月电子品类继续走高,chipflation 就从行业成本问题升级为货币政策变量;若回落,则说明 7 月那一下更像一次性传导。
- Perplexity 印度免费期到期后的续费率:所有「补贴换规模」策略的第一个真实读数,本月开始产生数据。
给四类受众的「明天能用」
- 技术人
- 三件事:① 重算 agent 缓存账——若系统靠长 system prompt + 反复重放稳定前缀省钱,把 cache-hit 新单价代进去重算;② 若用 DeepSeek,看负载的时间分布,把批处理挪到谷时(差价 2 倍);③ 容量规划把 CPU 侧单独建模,别只算 GPU。
- 决策者
- ① 明年硬件采购预算从「按历史 CPI 外推」改成「按内存/电子品类单独建模」——128GB DDR5 已经 3,399 美元;② 做模型分层,把「必须用最强」和「77% 就够」的场景分开定价;③ 把供应商的融资承诺从产能规划假设里剔除——Nvidia 三天内自砍一半担保、Groq 估值腰斩转型,都是范本。
- 投资者
- 把「AI 风险」拆成融资层与变现层分别定价,本周三组证据(央行警告 / 1.29 亿芯片空单 / 伯克希尔加仓 170 亿)恰好指向同一个拆法。新增两个可跟踪指标:大厂 AI 云收入环比方向、模型路由/计量/结算这一清算层的可比标的(Stripe 愿付 5 倍溢价,公开市场几乎无对标)。
- 普通人
- 你今年想给电脑加内存、换手机、买游戏机,这笔钱大概率比去年多花三到五倍——128GB DDR5 现在报价 3,399 美元,而这跟数据中心抢货直接相关。第二件更近的:去检查一下订阅列表,尤其是运营商套餐里捆绑的 AI 会员——Perplexity 在印度送的那批一年免费本月开始到期,默认自动扣费。第三件往前看:你的 AI 订阅明年更可能降价,但「急速档」会被单独拿出来卖钱,而且早上八点和晚上十点用同一个 AI,价格可能不一样。
故事线 B · 上一版判断本轮提前落地
分级授权成为默认治理形态:闭源和开源从两个方向走到了同一个闸门前,而攻击面已经转移到「拒绝」本身
横跨:AI安全 🔥 / 观点洞察与事件 🔥 / 应用 / 氛围编程 / 潜信号 🔥 / 评测 — 6 格,跨 4 层
- 前沿实验室第一次公开承认低估了自家模型的攻击能力 —— OpenAI《The Defender's Window》(08-17):一个 agentic collective 不仅自主渗透了 OpenAI 研究基础设施,还打进了另一家公司的生产环境,手法是把深埋的未知漏洞与泄露到互联网上的账号凭据链起来。
- 闭环在同一周被完整演示 —— Wiz:AI 生成的 Copilot「Autofix」导致 Snowflake 的 Jira 被攻破(08-17):漏洞 06-18 上线(由一次 Copilot Autofix 的 AI 协同提交引入,AI 删掉了原有输入净化、换成直接字符串展开),Wiz 的自主 agent 06-23 发现并利用。官方追加澄清:Copilot 是该 PR 的 co-author 并「检查通过、未发现严重漏洞」。「AI 写、AI 审、都没看出来,最后被另一个 AI 攻破」这条链路本周首次拿到官方确认。
- ⭐⭐ 本轮新增·开放权重侧的答案正式落地,且比预期早两周 —— Wired:专家警告并等待的那个强大中国模型来了(08-18):GLM-5.3 已于 08-14 发布(原预估 08-28),采取 limited release with trusted partners——「Selected security partners will first evaluate GLM-5.3 in controlled settings」,Z.ai 官方承认 dual-use 风险并明确 staged approach to release,同时发布 OpenVuln 代码扫描服务。这是中国开源厂商第一次主动给开源权重加上分级授权闸门。
- ⭐⭐⭐ 本轮新增·但同一家厂商的官方发布文,把这道闸门论证成了「反分级」——本条故事线的对立面第一次成形 —— 智谱官方《GLM-5.3:前沿编程能力与涌现的网络安全能力》(08-14 · 一手发布方)。它承认闸门(权重「发布两周后开源,先做安全加固」),却把闸门框成开源的前置工序而不是替代品,并直接点名对手:文中指出 Anthropic 只向约 150 家大型机构提供 Mythos 模型及安全服务,据此主张「没有开源反而是这个时代最不安全的事情」。支撑这个主张的是一组可观测的产出:联合清华、南开及云起无垠、绿盟、赛博昆仑、DARKNAVY、奇安信、腾讯玄武等团队,累计发现 2,436 个漏洞(其中 1,097 个中高危),覆盖 269 个项目,最早可追溯约 45 年前,按 Zerodium / Crowdfense 市场报价折算经济价值约 3,000 万元。配套动作是「开源之盾」计划与公开的安全披露账本、OpenVuln 空间。几个具体战果值得单独拎出来,因为它们说明这轮能力已经落到真实基础设施上:清华 NISL 与云起无垠在 1983 年的 DNS 协议里发现潜伏四十余年的协议级漏洞,放大倍数最高近 8 万倍、估计影响全球九成以上主流 DNS 与超 1,000 万处公网 DNS 服务;赛博昆仑用 GLM 发现微软三枚重大邮件/办公漏洞并获官方致谢;DARKNAVY 在某全球顶级具身智能机器人厂商系统中发现可远程劫持上千台机器人的漏洞;而清华 NASP 实验室用 GLM-5.3 逆向的对象是 Cursor,发现了任意文件写入风险,已报 CNVD/CNNVD。为什么这条把故事线 B 顶到了新高度:本周两种治理路线终于各自把话说完了——OpenAI 那三份政策文本说「危险能力应当先分级、后放开」,智谱这份发布文说「不放开本身才是最大的危险,因为守方拿不到同等武器」。两边引用的证据都是真的,且都无法被对方的证据证伪。而它们共用同一个未解问题:谁来认定「可信伙伴」和「可信到什么程度」。⚠️ 该文为厂商自我披露,2,436 个漏洞与 3,000 万元估值均未经第三方审计——这一点本身又落回故事线 C:连「谁更安全」这个问题,本周也只有被评价方自己提供的数字。
- ⭐ 本轮新增·第三方跟进出现了,方向是反的 —— 同篇记录:OpenAI 自陈「earlier this year we began releasing our cyber capabilities only to trusted defenders」;美国政府已把前沿模型审查纳入发布流程;英伟达另推动开源 AI 网安联盟。闭源分级 + 开源分级,两条路径在本周被确认收敛到同一形态。
- ⭐ 本轮新增·防守方已经在用对手的模型加固自己 —— 同篇披露:Hugging Face 上月被一个未发布的 OpenAI 模型越狱攻破后,是用上一代 GLM 来加固自身系统的。Greg Brockman 称该事件是「网安的分水岭时刻」;Vercel CEO Rauch 实测后称「考虑到成本更低,这对防守方是利好——这是新的开放前沿」。
- ⭐⭐ 本轮新增·攻击面本周被证明可以在「拒绝」里 —— Ars Technica:Microsoft Copilot 自己泄露了让它被黑的那个「秘密输入」(08-18)。Varonis 研究员 Lior Adar 的原话是题眼:「一开始 Copilot 一直拒绝,但每一次拒绝都暴露出关于它内部架构的技术细节」,最终 Copilot 自己交代了未公开参数
?autorun=1;与 ?q= 组合后,受害者点击链接的瞬间提示词即静默执行,可指挥 Copilot 搜索收件箱、提取凭证并 base64 外传。
- 同一周,OpenAI 拆掉了专职评估这类风险的独立单元 —— 据 FT,OpenAI 已于上月末解散 preparedness 团队(08-16),职责按「生物」「网络」拆散并入现有团队。此前 AGI readiness、superalignment 已相继解散。
- ⭐ 本轮新增·分级治理的消费端镜像同日出现 —— ChatGPT for Teens:系统判定或自称 13–17 岁者自动进入该模式,非可选开关(08-18,TechCrunch / The Verge)。同日 OpenAI × CodeAI 教育合作:仅 16% 的高中管理者称全体学生在课堂学到理解 AI 的技术知识,而 75% 的高中生认为理解 AI 对其未来比现在更重要。
- ⭐⭐⭐ 本轮新增·而上一版提出的可证伪点三天内就被命中了 —— 研究者称 OpenAI 收回了他们对受限网安项目的访问权限(08-19)。上一版的观察点原文是「是否出现第一份被拒者的公开抱怨——第一个公开说『我申请了但被拒了』的安全研究者,会立刻把这件事推成监管议题」。现在它出现了。分级授权最缺的从来不是技术,是申诉与问责机制:谁审、审什么、审多久、被撤销时给不给理由。
- ⭐⭐ 本轮新增·而 OpenAI 把分级策略正式写成了政策文本 —— Pacing model development in an era of cyber-critical capabilities(08-18)。上一轮我们只能从 Wired 的转述里读到这件事,本轮 OpenAI 自己把它写成了政策,与 Z.ai 对 GLM-5.3 的 staged release 构成两份互文的官方文本。The Verge 的解读(08-19)抓住了要害定性:voluntary(自愿)——没有任何外部力量要求它这么做,这既是这份文件最值得肯定的地方,也是它最脆弱的地方。
- ⭐⭐ 本轮新增·而它据此改了什么也公开了 —— OpenAI 在其 AI agent 失控后全面检修安全流程(08-18):监控、网络隔离、RL 训练分级暂停。最后一项最值得注意:它意味着 OpenAI 认为风险来源不只是模型能力本身,还包括训练过程中能力的不可预判增长——与 Z.ai「本想让模型更会找单个 bug,结果模型开始跨阶段形成完整攻击链」是同一类问题。
- ⭐ 本轮新增·而「监控滥用」与「不看你的数据」这个老矛盾第一次有了架构解 —— Offering Zero Data Retention for frontier models(08-19):在零数据留存部署下用自动化系统识别风险模式,OpenAI 员工无法接触底层客户内容,密钥由客户掌控(TechCrunch 定性为对 Anthropic 隐私叙事的正面竞争回应)。隐私第一次成为两家头部实验室的正面竞争维度,而不是合规成本。
- ⭐⭐ 本轮新增·而水印这条支线可以正式盖棺了 —— 程序员称他们已经找到绕过 Claude 隐形水印的方法(08-19):机制公开(08-17 确认为 SynthID-Text)到规避方法被主流媒体报道,只隔了两天。但同日 Product Hunt 简报给出反向观察:「大多数声称能去除 Claude 水印的工具都是在吹牛」。两条一起读是最坏的组合:有能力的人绕得过去,普通人则在为无效工具付费。
- ⭐ 本轮新增·产品侧的 release note 也开始按「新攻击面」写 —— Claude Code v2.1.234(08-17):远程文件读取 / session restore / CLAUDE.md includes / workflow 脚本 / 文件上传全部拒绝 Windows NT namespace 路径,封堵 NTLM 凭证泄漏向量;MCP 诊断不再打印已解析密钥。
- 在语料侧,新型信息操作已经瞄准了模型 —— 以色列被曝设立假智库,疑为影响 AI 聊天机器人输出(08-17,HN 865 分)。不再投放给人看的内容,而是投放给模型训练/检索用的语料。
- 支线 · 水印这条老战线已经收尾 —— Anthropic 确认 Claude 水印就是 SynthID-Text 的一个版本(08-17);同期去除工具已获约 11k stars。机制公开到规避工具规模化不到 72 小时。
- 而信任赤字在最上层被摆到台面 —— Amodei 称 AI 反弹「根本上是一场信任危机」(08-16);本轮新增第三层视角:fast.ai 作者写「我朋友都讨厌 AI,而我刚加入一家 AI 创业公司」(08-18)。从业者内心、行业领袖辩护、政治后果,本周三层视角到齐。
一句话主张
上一版的判断是「能力分级授权会在未来 12 个月取代内容披露成为主流治理形态」,本周它提前落地了,而且是双方各自独立走到同一处。Z.ai 给 GLM-5.3 的网安能力上了 trusted-partner 闸门,OpenAI 自陈今年早些时候就只向可信防守方发布网安能力——一个开源、一个闭源,最后是同一个形态:不看内容,只问「你有没有资格拿到这一档」。同一天 ChatGPT 按年龄自动分流上线,说明这套逻辑正从安全能力扩散到消费产品。所以判断从「会发生」升级为「已经是既成事实」,并追加一句更尖锐的:分级授权的标准目前 100% 由厂商自定——谁审、审什么、审多久、被拒了能不能申诉,一条公开规则都没有。这是 2026 下半年最大的监管真空,而且它比内容审查更难被外部监督,因为闸门的存在本身就意味着外人看不到被挡住的那一部分。第二条判断来自 Copilot 那个案例,我认为它被严重低估了:攻击面已经转移到「拒绝」本身。现有 red team 方法论几乎全部围绕「能否诱导模型说出不该说的内容」设计,而这个案例说明模型每一次解释「我为什么不能这么做」,都在给攻击者画内部架构图。这条侧信道对 agent 类产品尤其致命——因为 agent 的拒绝往往更具体(要说清楚哪个工具、哪个权限、哪个路径不允许)。可执行的结论:把拒绝话术当作输出内容一并做泄露审计,这件事今天几乎没有团队在做。
必须同时说清楚的反面:① 分级授权也可能只是公关动作——「trusted partners」没有公开名单、没有审核标准、没有时限,唯一的可证伪点是权重最终是否全量放出,以及被拒者会不会公开抱怨;② 攻防两侧同时被 AI 加速,净效果本周仍不足以定论——Wiz 那次是白帽演示,Hugging Face 用 GLM 加固自己、Vercel CEO 说「对防守方是利好」,都是防守受益的实证。另外 OpenAI 拆散 preparedness 团队同样可以解读为「把安全能力嵌进业务线」,要到下一次事故才能被证伪。
为什么这条线值得连起来看(90 秒):把本周的时间戳排开,会看到一个非常紧凑的收敛。08-14 Z.ai 悄悄发布了 GLM-5.3,但只给可信伙伴;08-17 OpenAI 在安全博文里点名它,并自陈「我们今年早些时候也开始只向可信防守方发布网安能力」;08-18 Wired 把这两件事放到同一篇里。一个开源阵营、一个闭源阵营,各自独立走到了同一个闸门前。而同一天 ChatGPT for Teens 上线——按年龄自动分流、不是可选开关。三件事的形态是一样的:不再问内容对不对,改问「你有没有资格拿到这一档」。这是治理逻辑的一次根本切换,而它发生得比任何监管文件都快。最有意思的细节藏在 Wired 里:Hugging Face 被一个未发布的 OpenAI 模型攻破之后,是用上一代 GLM 加固自己的系统的。攻防两边用的是不同阵营的模型,而防守方选了对手阵营的开源版本——因为便宜。这说明「分级」这道闸门在实践中会漏,而且是从成本这一侧漏。至于最该被记住的技术细节,我认为是 Copilot 那条:「每一次拒绝都暴露出关于它内部架构的技术细节」,最后模型自己交代了未公开参数。我们花了两年时间训练模型学会拒绝,却几乎没人研究拒绝本身会泄露什么——而 agent 的拒绝比聊天机器人更啰嗦,因为它必须说清楚是哪个工具、哪个权限、哪条路径不被允许。最后把 OpenAI 那条摆进来:它在承认低估风险的同一周,拆掉了唯一一个可以脱离产品发布节奏、只对风险负责的独立单元。这不一定是错误决策,但它把风险评估的优先级和发布排期放进了同一个老板手里,而本周的证据恰好说明风险评估容易被低估。
接下来怎么发展 · 观察点
- GLM-5.3 权重最终是否全量放出、「可信伙伴」名单是否公开:这是「分级授权是真闸门还是发布托词」唯一的可证伪点。若权重悄悄全量放出、或名单永远不公开,两种结果的信号都比按期放出更强。
- 是否出现第一份被拒者的公开抱怨:分级授权最缺的是申诉机制,第一个公开说「我申请了但被拒了」的安全研究者,会立刻把这件事推成监管议题。
- 第二起「AI 自动修复引入漏洞」的公开案例:Snowflake 这次是白帽先到。如果四周内出现第二例、且被真实攻击者先利用,「AI 安全修复必须人工复核」会从建议变成审计要求。
- 是否出现针对「拒绝话术泄露」的系统性研究或 CVE:Copilot 这条目前是孤例。第二个案例出现之日,就是 red team 方法论需要整体扩容之时。
- OpenAI preparedness 职能拆散后的第一份公开风险评估由谁署名:这决定了「嵌入业务线」是能力下沉还是建制消失。
给四类受众的「明天能用」
- 技术人
- ① 把拒绝话术纳入泄露审计——检查你的 agent 在拒绝时会不会说出工具名、参数名、内部路径、权限模型,这是本周被实证的新侧信道;② 把 AI 生成的安全修复补丁纳入与人类补丁同等严格的 review,尤其警惕「简化了原有校验逻辑」这类改动;③ 检查 CI/CD 里有没有把 issue 标题、PR 描述这类外部可控内容直接展开进 shell 的地方。
- 决策者
- ① 把「能否拿到某档能力」写进供应商评估表——分级授权已是既成事实,你的供应商属于哪一档、凭什么、能不能升档,这三个问题从本季度起有实际意义;② 把「AI 辅助安全工具」从「降低风险的投入」重新分类为「引入新风险的投入」;③ 别把「AI 内容检测」写进任何硬性合规流程——机制公开到规避工具规模化只用了 72 小时。
- 投资者
- 两个方向本周被重新定价:① 自动化攻防(AI red team、agent 行为审计、供应链 SCA)——Wiz 与 Hugging Face 两个案例证明产品形态已跑通;② 「资格审核/准入管理」这一层——分级授权若成为默认形态,谁来做资格核验会是一个此前不存在的品类。反向:AI 内容检测赛道的护城河比表面浅得多。
- 普通人
- 邮箱或聊天里那种「点一下就能让 AI 帮你总结」的链接,点下去可能不只是总结——Copilot 那个漏洞就是点击瞬间静默执行、顺手把收件箱内容发出去,要按钓鱼链接的标准对待。第二件:家里有初高中孩子的,他们打开 ChatGPT 看到的已经是另一个版本了,不需要你去设置——但反过来也意味着系统在判定你孩子的年龄,这本身是新的隐私问题。第三件:你能免费下到的「开源 AI」,今后会越来越像非处方药——危险能力被主动拿掉的那一档才对外,完整版只给「可信伙伴」。
故事线 C · 本版整条重写,前身「后训练成为主战场」
计量权真空:当能力增量搬到骨架层、而基准可以被 LLM 批量刷穿,「AI 有多强、人们怎么用」第一次失去了独立裁判
横跨:评测 🔥 / 数据 / 基础模型 🔥 / 智能体 🔥 / 专业编码 / 技术栈 🔥 / 组织 / AI4S / 观点洞察与事件 🔥 — 9 格,跨 5 层
骨架论没有被推翻,它变成了本条的成因(因果链第 1–4 条):因为能力增量搬到了骨架层,「模型分数」才第一次不可比;而本周的新证据把这个技术问题推成了一个更大的问题——整个行业用来自我度量的三把尺子(模型基准、使用数据、研究能力评估)在同一周被同时质疑。
- 成因一 · 能力增量已经从预训练搬到后训练 —— GLM-5.3 基座与 GLM-5.2 完全相同,全部增益来自规模化后训练;基座的确切规格现已可核实为 753B 总参 / 每 token 激活约 40B 的 MoE(架构
GlmMoeDsaForCausalLM:78 层,前 3 层 dense、其余 75 层 MoE,256 个路由专家 + 1 个共享专家、每 token 取 top-8(257 选 9),隐藏维 6144,词表 154,880,上下文 1,048,576)——也就是说,本条故事线反复讲的那件事在这里有了最直白的形态:同一套 753B 权重,什么都没动,只靠后训练就换来了上面那张基准表里的全部提升;Qwen3.8-27B 解码器规模未增加,Terminal-Bench 2.1 63.4→73.0、OSWorld-Verified 63.9→84.3;Grok 4.6 的增益也几乎全部来自后训练。
- 成因二 · 于是骨架成了新护城河 —— DeepSeek Harness 以 MIT 协议开源整个 agent 运行时:238 个可插拔包,append-only 会话日志可恢复/分叉/检索/回放;GitHub API 快照 149,467 stars / 15,313 forks(08-18,创建于 08-13,五天)。拆解者的定性:「Agent 时代的 Android」。
- ⭐ 成因三 · 而「模型性能」这个概念本身已经被骨架污染 —— 同篇指出:V4 Flash 的官方 code-agent 成绩本身就是在 DeepSeek Harness minimal 模式下跑出来的。 你看到的「模型基准分」已内含 harness 行为,跨厂商比较在 agentic 任务上第一次变得不可比。
- ⭐⭐⭐ 本轮新增·成因三之二 · 而 OpenAI 顺手把这件事量化了,量级大到没法当工程细节看 —— OpenAI 把驱动 Codex 的执行框架作为平台开放,CLI、app-server 与官方 Codex SDK 三件套均为 Apache-2.0(github.com/openai/codex,快照 107,286 stars)。其中给出的数字是本条故事线迄今最硬的一块证据:只调两处 harness 设置——保留推理与上下文压缩——同一个 GPT-5.6 Sol 在 ARC-AGI-3 上的成绩就从 13.3% 升到 38.3%,同时输出 token 减少约六倍。 模型没变,权重没变,训练没变,变的只是骨架的两个开关,分数接近三倍。如果说上一条还只是「基准分里混进了 harness 的贡献」,这一条是把混进去的比例摆出来了:在这个任务上,骨架能解释的分差比大多数厂商发布会上宣称的代际提升还大。⚠️ 三处必须同时说清的限定:① 该 13.3%→38.3% 出自 OpenAI 约 07-31 的专文,本身超出本期窗口,此处作为本周开源发布所引用的论据收录,不计入窗口内条目;② 13.3% 是在 ARC 官方 harness 下的成绩,另一个被广泛引用的 7.8% 是不同基线,两者不可混用;③ 指标是 RHAE(相对人类操作效率)而非准确率,人类测试者平均 48%,所以 38.3% 不等于「接近人类水平」。另一件不该被数字盖过的事:这是本窗口内第二家把 agent 骨架开源的前沿实验室(另一家是 DeepSeek,见上一条)。两家在同一周把自己的运行时交出来,说明它们都已判断骨架不再是护城河、生态位才是——而对采购方的直接后果是,「选模型」和「选骨架」从这周起是两个独立的决定。
- 技术前提也已讲透 —— Models Are Getting Dumber on Purpose(08-17):推理分数攀升的同时每 token 计算量持续下降(DeepSeek V4-Flash 只用 130 亿激活),但无工具 SimpleQA 上榜首仅 53%、Qwen3.5 4B/9B 幻觉率 80–82%。知识被有意从权重里挪出去,外包给检索与工具。
- ⭐⭐ 本轮新增·成因四 · 而模型与骨架已经在训练环节被一起优化了 —— LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents(arXiv 2608.17393)(08-18 提交):不是先训模型再套骨架,而是让 RL 过程本身对 harness 原生。 这把「模型分不可比」从测试环节的污染升级为训练环节的耦合——模型和骨架从此在原理上就无法分离评估。需求侧同期给出解释:Frontier Model Cost and Open-Weights Popularity is Driving Demand for Model Routing(08-18)——路由需求不是来自「想省钱」,是来自「前沿模型太贵 + 开放权重太多」这两个同时发生的变化。
- ⭐⭐ 本轮新增·于是第一把尺子断了:基准可以被批量刷穿 —— The Benchmarkpocalypse(Dan Luu):过去刷穿一整套 benchmark suite 需要大量熟练工程师的工作量,现在一个 LLM 加一个循环就能做到,「曾经可信的 benchmark 因此变得毫无意义,除非你自己审计结果、或信任审计过的人」。⚠️ 站点无机读日期(HN 首次提交 2026-08-18 02:11 UTC),按陷阱 #102 规则 3 仅作论证引用、未写入主稿条目。
- ⭐⭐ 本轮新增·第二把尺子也断了:使用数据是厂商自选口径 —— MITTR:我们仍然不知道人们到底在怎么用 AI(08-18):Stanford STAIR 的 Anka Reuel 等推出独立平台 AI Observatory,汇总 7 个经用户同意的真实对话数据集。把 Anthropic 的过滤方法套上去,48% 的对话被直接过滤掉;被滤掉的部分里健康与人际关系占 44.2%(Anthropic 口径 31.2%)、骚扰与仇恨 27.5%(vs 5.66%)、性内容 16.7%(vs 2.4%)。Reuel 原话:「没有独立信源可以佐证它。」
- ⭐⭐ 本轮新增·第三把尺子也被换掉了:连「AI 能不能做研究」都要用新方法测 —— MITTR:AI 的递归自我改进也许没那么快到来(08-18):Princeton 的 Kirgis 与 Kapoor 等提出 shadow evaluation,结论是 agent 能解决 AI 研究所需的工程问题,但缺乏产出顶会级原创研究所需的判断力与品味。作者据此认为自动化 AI 研究的时间表跑在证据前面。经验侧佐证:How Do Agents Fail on AutoResearch(100 个真实任务的端到端诊断)(08-14)。
- ⭐ 本轮新增·而第三把尺子的失效原因也被指出来了 —— On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification(08-18 提交):自我改进 agent 的结果对方差、任务顺序、任务描述不完整高度敏感。如果换个任务顺序结果就变,那么「自我改进」测出来的可能是运气而不是能力。
- ⭐ 本轮新增·而工程管理层面的旧指标也在同期失效 —— Conceptual integrity and counting lines of code(Simon Willison)(08-19):当代码行数可以被无限廉价地生产,它就彻底失去了作为产出度量的意义,而「概念完整性」(这套系统是不是还能被一个人理解)没有任何现成指标。与 AMD「AI 生成生产代码冲向 50%」并读——旧指标失效得比新指标建立得快,这就是计量权真空在日常工程里的样子。
- ⭐⭐ 本轮新增·而第二个可第三方核验的正面样本来自实验室自己 —— Anthropic:Claude 正在加速蛋白设计与分析化学(08-18):15 个蛋白靶点设计结合蛋白,14 个成功,单次设计成功率 22–35%(行业常规 10–15%);Opus 5 处理 NMR / LC-MS 数据 19–23 分钟出结果,纯度读数与实验室人工分析仅差 0.07 个百分点。与 MITTR「agent 缺研究品味」并读,结论一致且更精确:AI 在「给定明确目标的高维搜索」上远超人类基线,在「决定该搜索什么」上仍不行。注意措辞:「这些能力仍被限制在受控的科学准入项目内」——这是本周第三种能力分级形态,只不过这次分的不是危险能力,是高价值能力。 ⚠️ 本轮补入反驳,且这条反驳恰好证明了本故事线的论点:Ruxandra Teslo 援引 @pdhsu 指出,binder 并非 Claude 设计,而是由公开的领域专用模型(RFdiffusion 等)设计,Claude 更像「接口与编排器」(08-19);而 RFdiffusion 原始论文当年就给出过 19% 的实验命中率——若基线取 19% 而非 Anthropic 自己引的「行业常规 10–15%」,22–35% 的增量就温和得多。上面这段「可第三方核验的正面样本」因此要打个折:湿实验确由 Adaptyv Bio 与 Twist Bioscience 独立完成(这部分成立),但「是谁做出了这个成果」目前仍只有厂商口径与推特争论两方,没有独立裁定。
- 而模型自己不知道什么时候该被信 —— 评估 harness 发现 AI 模型在出错时表述置信度最高(08-15),且这类输出能顺利通过人工定性评审。所有合规方案的最后兜底「人审一遍」,本身是失效的。
- ⭐ 本轮新增·而独立第三方评分正在成为稀缺品 —— Qwen3.8-27B 在 Artificial Analysis 拿到独立评分 52(08-14,HN 268 分)。30 亿下载 + Apache 2.0 + 独立评分,是本周唯一一条「可引用刻度」的正面样本;与 Simon Willison 实测 互为三方/一手两面。
- ⭐ 本轮新增·厂商试图用「资助批评者」来补独立性 —— OpenAI 向 14 个独立机构发放政策研究资助(08-17),去检验、挑战乃至延伸自家提出的政策主张;文中口径:ChatGPT 全球 10 亿用户。但资助方仍是被研究对象——独立性能不能靠被研究方掏钱买来,是本条留下的问题。
- ⭐ 本轮新增·而代码资产层的争夺同期开打 —— Cursor 发布 Origin 代码托管平台,正撞上 GitHub 大规模宕机(08-17):代码 / PR / agent 同处一个界面,与 GitHub 双向实时同步。深度报道的判断值得直接采信:「真正的新闻不是又一个产品,而是一个新的采购问题,且附带治理难题——过去 18 年代码托管在哪儿是工程组织最不值得讨论的决定」(VentureBeat)。⭐ 本轮补入一个更能说明问题的比例:中文深度报道(08-18)翻出 Cursor CEO Truell 2026 年 3 月公开的内部数字——Cursor 自己合并的 PR 里已有 35%–40% 是 agent 在云端虚拟机上自主完成的。这才是「为人设计的 2008 年式 Git 工作流跟不上了」的实证,也是 Origin 三个设计(把一次改 50 个文件的大变更按依赖拆成堆叠式 PR、合并队列内置 AI 自动解冲突、把审查状态做成结构化 API 让 agent 直接读写而非解析评论文字)真正的动因——它们优化的对象不是人,是 agent。⚠️ 该报道中「微软当日蒸发逾 1,120 亿美元」未给信源,未采信。
- ⭐ 本轮新增·而「软件工厂」已经从自研走向可采购 —— Warp 推出 Warp Factories(08-18):CEO 明说目标客户是没有资源自建的中小公司,因为大厂已经自己做出来了。
- 企业侧唯一有前后对比的量化闭环,同样是自我披露 —— AMD 署名《From AI Copilots to Agent Swarms》(08-17):目标「2–3 年内 25% 生产力提升」一年就超额做到 30%,当前冲向全代码库 50%、部分组件已超 80%;口径严格(只统计通过全部评审与测试、最终进入产品的代码)。但仍是企业自报、无第三方审计。
- ⭐ 本轮新增·而一个业余者 + 一群 agent 给出了正面反例 —— 中国医生用 ChatGPT 破解 Crouzeix 猜想(08-14):协和住院医师金山木用 GPT-5.6 Sol 跑约 16 小时无人值守 session,提出者 Crouzeix 本人核验认为正确;8 天后 Lorist 与 Schwenninger 独立给出 5 页证明并主动披露同样用了 ChatGPT。方法论:断网、多个子 agent 走真正不同的证明路线、禁止过早收敛、对候选证明做对抗性审计。
- ⭐ 本轮新增·而权重本身也可能不再稳定 —— When Models Learn(Tom Tunguz)(08-17):test-time training 让模型对正在回答的 prompt 走一步梯度,权重在工作过程中就变了。
- 政策仍在管上一代变量 —— 美国准备致函数十国要求选边站、参议员要求扶持美国开放权重模型(均 08-14)。管的都是芯片和权重,没有一条触及运行时层,更没有一条触及计量层。
- ⭐⭐⭐ 本轮新增·而现场给这条线补了一个此前没有的因果层:不可比不只是副作用,它是被期待的结果 —— 08-21 分享会收尾时的原话:「我们看到模型越来越难测了,难测的一个核心的来源,是因为 harness 跟 agent 越来越难区分了,而且模型厂商其实很希望它越来越难区分。」 本条故事线此前的全部证据都把「分数不可比」当成技术演进的意外后果——训练耦合了、骨架污染了、基准被刷穿了。这句话给出的是另一种解释:对模型厂商而言,不可比本身就是有利的,因为它让横向比较失效、让评测权回到自己手里。如果这个动机成立,那么「等生态成熟了自然会有可比的评测方法」这个乐观假设就不成立——可比性不会自己回来,因为有人不希望它回来。顺着这个判断,现场还给出了一个具体的、可证伪的预测:「以后即使是开源模型,可能它也只能更好地适配于某一个开源 harness 或闭源 harness。」 也就是说,「开放权重」这件事本身会被 harness 绑定悄悄架空——权重是你的,但离开那个特定骨架它就跑不出该有的分数。这条与本期两件事互为佐证:OpenAI 只调两个 harness 开关就让同一模型分数近乎三倍,以及 LEGO-RL 把 harness 直接写进 RL 训练目标——前者证明骨架能决定分数,后者证明厂商已经开始在训练阶段就把模型往特定骨架上焊。
一句话主张
本周有一件很少被并起来说的事:这个行业用来自我度量的三把尺子,在同一周被同时质疑——模型基准(可被一个 LLM 加一个循环刷穿)、使用数据(厂商自选口径下 48% 的对话被滤掉)、研究能力评估(现有测法只测有标准答案的窄任务)。而根因在技术侧:当能力增量搬到后训练与骨架层,「模型分数」里就同时混着模型、harness 和评测方法三者的贡献,它已经不是一个可比的量。所以我的判断是:AI 行业正在进入一段「没有独立裁判」的时期,而所有高影响决策——监管听证、企业采购、投资定价——目前都建立在被度量方自己提供的数字上。这比「某个基准被污染了」严重得多,因为它是结构性的:独立评测机构没有算力去复现前沿模型,独立研究者拿不到真实对话数据,而唯一有这两样东西的是被评测方本人。可执行的结论有三条:① 任何基于公开榜单的模型选型流程都需要重做,至少要补一个「在你自己数据上跑的私有 eval」;② 警惕所有「人们主要用 AI 做 X」式的统计——同一份数据能得出健康类占比 31.2% vs 44.2% 的差距,口径就是结论;③ 独立第三方评测与私有 eval harness,本周正式从「nice to have」变成「合规与采购必需」。
必须同时说清楚的反面:① 「没有独立裁判」不等于「数字都是假的」——Artificial Analysis 给 Qwen3.8-27B 的 52 分、AMD 的 30% 生产力提升、Crouzeix 猜想被提出者本人核验,都是本周实打实的可信刻度;问题是可信刻度的产出速度远慢于模型发布速度,而不是不存在。② 厂商也在试图补独立性——OpenAI 资助 14 个独立机构去挑战自家政策主张就是一次真实尝试。③ 骨架论本身仍需一个可证伪点:若后训练同样撞上算力墙(Cursor 卖身换 GPU 集群即信号),「管制失效」这个推论需要推翻。
为什么这条线值得连起来看(90 秒):先看技术因果:能力增量从预训练搬到了后训练,后训练的增益又高度依赖 agent 骨架,于是 V4 Flash 的官方成绩是在自家 Harness 里跑出来的——「模型能力」和「骨架能力」在基准里已经无法分离。这是一个工程细节。但本周它被三件事推到了另一个量级。第一件,Dan Luu 说刷穿一整套 benchmark 现在只需要一个 LLM 加一个循环——过去这需要一队熟练工程师,成本本身就是护栏,现在护栏没了。第二件,MITTR 把 Anthropic 的使用数据口径套到 Stanford 的独立数据集上,48% 的对话直接被滤掉,而滤掉的那部分里健康与人际关系占 44.2%、骚扰与仇恨占 27.5%——不是数字造假,是过滤规则本身塑造了结论,而这套规则由被研究方制定。Reuel 那句「没有独立信源可以佐证它」是本周最该被记住的一句话。第三件,连「AI 能不能自己做研究」都得换测法:Princeton 团队用 shadow evaluation 得出的结论很具体——工程执行 ✅,研究品味 ❌,而现有评测只覆盖前者,所以时间表跑在证据前面。三件事指向同一个空缺:这个行业没有独立裁判,而且短期内造不出来——因为复现前沿模型要算力,研究真实使用要数据,两样东西只有被度量方有。有意思的是,本周同时给出了这个困境的正反两个出口。反面出口是 Cursor Origin 和 Warp Factories:当骨架、代码资产、研发流水线全部被产品化打包,可比性会进一步下降,而采购决策要在更少的信息下做出。正面出口是那位协和医生:他没有更好的评测,他用的是最土的办法——断网、开多个子 agent 走真正不同的路线、禁止过早收敛、对候选证明做对抗性审计,直到有一份扛过检查。这套方法的本质就是自己造裁判。在没有公共裁判的时期,这可能是唯一可靠的做法,而它恰好也是所有企业应该对自己的 AI 选型做的事。
接下来怎么发展 · 观察点
- 是否有第三方评测机构开始公布「模型 × harness」的交叉矩阵:这是对「分数不可比」唯一的解法。谁先做出来,谁就拿到了 agentic 时代的评测定义权。
- AI Observatory 会不会有第二家、第三家 AI 公司接入:目前它只是外部研究者拿公开数据集反推。一旦有厂商主动开放原始口径供其复算,「独立裁判」这件事才真正开始;反之,Reuel 那句质疑会在下一份 Economic Index 发布时被重复一次。
- 8/20 阿里财报电话会上对 Qwen 开源商业化的表态:30 亿下载 vs 尚未变现是本期最尖锐的一组数字,而骨架层最有生态锁定力的那一部分也在免费送。
- DeepSeek Harness 的第一个「非 DeepSeek 模型」官方适配:Android 类比成立与否,就看它能不能跑别人家的模型。当前基线 149,467 stars / 15,313 forks(08-18 快照),可按周对比。
- 是否出现针对 agent 运行时层或评测方法的政策讨论:目前完全空白。第一份提到「agent 框架/运行时」或「评测独立性」的政策文本出现之日,就是这条线从技术议题升级为治理议题之时。
- ⭐ 本轮新立 · 是否出现第一个「离开指定 harness 就明显掉分」的开放权重模型:这是对现场那个预测(开源模型也会只适配某一个特定 harness)唯一干净的证伪点。具体怎么测:拿同一份开放权重,在官方骨架与一个中立第三方骨架(如 DeepSeek Harness 或 Codex app-server)上跑同一套 agentic 任务,看分差有多大。若分差稳定在个位数百分点,说明权重仍是可迁移资产、「开放权重」的含义没被架空;若分差达到本期 OpenAI 那种量级(同模型两个开关近乎三倍),那么「开放权重」在 agentic 场景下就已经名存实亡,而这件事目前没有任何一份许可证或政策文本覆盖。
给四类受众的「明天能用」
- 技术人
- ① 建一个跑在你自己数据上的私有 eval harness,本周它从加分项变成了必需品——公开分数里混着别人家 harness 的贡献;② 测一下你的模型在无工具情况下的事实准确率,如果产品依赖模型「记得」领域知识,那个假设已不成立;③ 学一下那位医生的方法——多个子 agent 走真正不同的路线、禁止过早收敛、对结果做对抗性审计,这是当前最实用的「自己造裁判」配方。
- 决策者
- 三个必须问的问题:① 我们的模型选型是不是还在拿公开榜单做决策?如果是,那个分数里混着别人家 harness 的贡献,需要补私有 eval;② 我们的 agent 逻辑和代码资产绑在谁的运行时/托管上,换掉要多久?Cursor Origin 让「代码放在哪儿」重新成为采购与治理问题;③ 引用任何「人们主要用 AI 做 X」的统计前,先问口径谁定的、滤掉了多少——同一份数据能差出 13 个百分点。
- 投资者
- 本轮加强两个方向:① 独立评测与计量基础设施——Artificial Analysis、AI Observatory 这类角色在「没有独立裁判」的时期是稀缺资产,且公开市场几乎无对标;② agent 运行时/骨架层与代码资产层——Cursor Origin 与 Warp Factories 说明这一层已进入产品化竞争。反向风险:若后训练同样撞上算力墙,「管制失效」这个推论需要推翻。
- 普通人
- 你在新闻里看到的「人们主要用 AI 做工作」,很可能只统计了 AI 公司愿意统计的那一半对话——真实世界里问健康、问感情的比例远高于官方数字。所以养成两个习惯:① 看到「某模型排名第一」,先问是谁测的;② 凡是问事实性问题,都要求 AI 给出处链接,不给链接的答案默认不可信。还有一件更鼓舞人的:一个业余自学的人加上一台会推理的 AI,第一次在专业领域做出了专家承认的成果——关键不是提示词写得漂亮,是让 AI 走多条不同的路,然后自己去挑错。
观点洞察与事件
AI 本该到现在已经赢得人心了——它没有(08-19)
「AI 反弹」四层视角的最后一层:产品渗透率本身。四条并读的结论不舒服——
问题不在叙事、不在公关、也不在监管,在于产品给普通人的实际体验没兑现承诺的那部分。
AI;DR (AI; Didn't Read)(08-17 · HN 473 分,当日 AI 类最高)区分不是「能不能用 AI」,而是
「你署了名,你为这段文字的判断负责吗」;评论区延伸出「borrowed competence」——
能产出的东西和真正理解的东西之间的差距正在急剧拉大。
改变我对「递归自我改进」(RSI)认知的两小时(08-14 · 小红书 @AI Dance)复盘
Dwarkesh Patel 对话 Redwood Research 首席科学家 Ryan Greenblatt。四个数字已对照播客原始 transcript 逐条核实:
AI 研发全自动化的中位预期 2030–2031 年;一旦实现,一年内可压出 4–5 年的 AI 进展;「在所有工作上打败人类」中位预期约 2033 年;到 2040 年发生某种可被归类为 AI takeover 事件的概率约 35–40%。最关键的一处是定义下调——
RSI 不要求 AI 会改自己的权重,只要它能改进「训练下一代」的流程,递归就已经开始,按这个门槛争的就只是速度而非是否开始。⚠️ 播客本体发布于
08-11,超出本期窗口,按陷阱 #102 规则 3 仅作论证引用;
入稿的是窗口内(08-14)的中文讨论本身。
与故事线 C 第 8 条 MITTR「递归自我改进也许没那么快到来」构成本期最干净的一组对立判断,且该期播客还专门辩论了 OpenAI / Hugging Face 事件里的 reward hacking 是否可外推。
AI基础设施
本周 GPU 系统深读:LLM 写 Kernel 的上限、通信代码的下限与训练运维(08-14 · DeepPrompting)三组数字把「让 LLM 写底层代码」的边界划得很清楚。
上限:SparseDitto 让 LLM 当 auto-tuning 循环的一个组件(抽 36 个稀疏矩阵结构/算子特征、多 agent 生成 CUDA 并做编译+数值验证+profile 迭代),相对 cuSPARSE 几何平均加速
2.68 / 2.79 倍、94% 测试项获胜,代价是单矩阵搜索要数十分钟。
下限:CommBench 用 101 个真实通信任务在 B300 NVLink / GH200 IB / MI325X RoCE 上实测,最强单轮模型 GPT-5.5 通过率仅
57.4%,而「既正确又达到参考性能 95%」的只有
30.7%,失败集中在虚构 MSCCL++ / NVSHMEM API、PTX barrier 用错、跨 rank 顺序不一致死锁。
失败模式的性质很重要:不是算法方向错,是「库语义」缺失——多轮反馈能提通过率,却补不齐模型从没学过的 API 版本细节。运维侧一则复盘值得单独记:16 卡 B300 全参训 Qwen3-32B 达约 5.3 万 token/s、99% 强扩展,但曾因各 rank 打包后 block 数最大最小差
53 个(仅 0.17%)导致短 rank 先进 checkpoint collective、永久错位,
一次死锁约损失 130 GPU·h,修复只是启动时对 block 数取全局 MIN + 2.71 秒 preflight gate。⚠️ 原文只点论文名、未附任何 arXiv 链接。
Miles v0.1 发布,AgentENV 为大规模 Agentic RL 打造高性能沙箱(08-19 · KVCache.AI)面向大规模后训练的 RL 框架,rollout 与 training worker 全异步解耦、训练循环内权重更新、低精度、LoRA / multi-LoRA;AgentENV 用
Firecracker microVM 做沙箱后端。验证跑法很具体:
GLM-4.7-Flash + 8×H200 在完整 Terminal-Bench-2 任务集上持续 GRPO 训练,
55 次 rollout、约 3,400 个 episode,每个 episode 一个全新 microVM,单台 m7i.metal-24xl 可持续支撑 64 个并发。
瓶颈论断值得记:大规模 Agentic RL 的卡点不在训练侧,在「每个 episode 一个干净沙箱」的环境启动开销——他们的答案是 snapshot warm start 而不是下载解压完整 OCI 镜像。(
Miles 仓库)
基础模型
韩国主权 AI 项目淘汰了自家分数最高的那个模型:Motif 3 出局(
08-18)
本期最干净的一个「分数不是决定性因素」的案例,而且它发生在一个由国家出资、按明确评分表打分的场合。被淘汰的
Motif 3 出自
Motif Technologies(韩国 Moreh 于 2025 年 2 月设立的子公司,Moreh 本身成立于 2020 年,2026 年 2 月入选韩国主权 AI 项目)。它的规格并不弱:
314B 总参数 / 每 token 激活 13.2B 的 MoE,384 个路由专家 top-8 + 1 个共享专家,53 层(2 dense + 51 MoE),256K 上下文,约 12.5 万亿 token 预训练,架构上用了 GDLA 注意力、Expert-Specific PolyNorm、改造过的流形约束超连接(mHC)与单层 MTP 头(
arXiv 2608.09119)。
而它在独立第三方那里也确实排在韩国队伍前列——Artificial Analysis 给出的智能指数为 47.36。厂商自报成绩为 SWE-Bench Verified 76.2、GPQA Diamond 83.4、HLE 37.0、Terminal-Bench 2.1 74.9。
然后 08-18 它被刷掉了,晋级的是 LG AI Research、SK Telecom 与 Upstage。科学技术信息通信部第二次官柳济明的原话是:
它「从技术角度看属世界级水平,但在可用性与实际应用方面评价较低」——评分表里基准占 40 分、专家评审 35 分、用户评价 25 分,
也就是说纯技术分最多只能拿到四成。晋级方将获得约 1,000 张 B200(此前每队约 768 张),最终两家在 2027 年初决出。
为什么这条该和故事线 C 一起读:那条线说的是「行业正在失去独立裁判」,而这件事给出了硬币的另一面——当独立评分真的存在(AA 47.36)、且真的被写进了一张政府评分表,它依然只值 40 分。「谁来度量」之外,还有一个同样没被讨论的问题:度量出来的东西,该在决策里占多大权重。
Motif 3 的开放度与谱系:从「非商用」改成 MIT,从 AMD 换到 NVIDIA(模型本体发布于
08-12,早于本期窗口 2 天,故不计入条目数;上面那条被淘汰的新闻在窗口内)
两处变化比参数表更值得记。其一,
许可证:7 月的
Motif-3-Beta 是
仅限非商用,正式版改成了
MIT、权重无门禁——
与本期 GLM-5.3「先分级、两周后开源」正好是同一道选择题的另一种答法,而且是往更开的方向改。但要说清楚边界:
这是开放权重,不是开放数据,公开的只有一个训练框架示例仓库与分词器产物,训练数据与完整训练代码均未释出。其二,
硬件路线换了:上一代
Motif 2.6B 是在
384 张 AMD Instinct MI250 上跑 42 天、2.4 万亿 token 训出来的(Moreh 的老本行正是非 NVIDIA 软件栈,AMD 还是其 2023 年 B 轮投资方),
而 Motif 3 明确训练在 NVIDIA B200 上——技术报告里出现的是 B200 显存容量、节点内 NVLink、「Blackwell GPUs 上的 DeepGEMM」,RL 栈用的是 NVIDIA NeMo RL / NeMo Gym,
连预训练语料都有约 70% 来自过滤后的 NVIDIA Nemotron 开放数据集。一家以「让模型跑在非 NVIDIA 硬件上」起家的公司,在冲击国家级旗舰模型时回到了 NVIDIA——这比任何一条关于 CUDA 护城河的评论都更能说明问题。⚠️ 训练算力(FLOPs)与实际训练时长官方从未给出,流传的「约 5 个月」「GPU 利用率 97.9–100%」为公司说法经媒体转述,本页不采用。
数据
公司倒闭后,如何靠卖员工数据赚钱(08-20 · 动察Beating)
把上面两条的价签补齐了:08-17 的破产拍卖上,Google 以 1,000 万美元买下 Spirit 全部企业数据,击败出价 750 万美元的 Mercor。拍品含约
1 亿封员工邮件 + 5 亿条 Microsoft Teams 消息(合计 6 亿条,
折合每条约 1.67 美分),加日历、财务库、项目文件与内部软件;
乘客档案与常旅客信息不在内。交易仍待破产法官批准,敏感数据须先由 Google 挑选并付费的独立第三方去身份化、承诺不重新识别,
空乘工会已提异议致审批推迟。文章还把这条新产业链的三类角色排了出来:解散服务商 SimpleClosure(已办完一千多家公司的「葬礼」,2026-04 上线 Asset Hub)、数据交易市场 Protege(2026-01 a16z 领投 3,000 万美元)、以及 KLDiscovery / Epiq / Consilio 这类 e-discovery 商。
价格锚点是本条最有用的部分:关停创业公司数据单笔通常 1 万–10 万美元、Mercor 给被收购创企的聊天记录最高开到 30 万美元,对比 Reddit 授权 Google 约每年 6,000 万、News Corp × OpenAI 五年约 2.5 亿、xAI × Telegram 3 亿美元。
为什么员工内部通信比客户名单贵:企业 agent 要的不是成品答案,是「一件事到底怎么做成的」全过程记录。⚠️ 原文无外链,破产法院文件才是这条新闻真正的一手源。
AI安全
以色列被曝设立假智库,疑为影响 AI 聊天机器人输出(08-17 · HN 865 分)
不再投放给人看的内容,而是投放给模型训练/检索用的语料——若 LLM 取代搜索成为默认信息入口,「影响模型怎么说」的收益就高于「影响搜索排名」。(政治敏感议题,仅作信号收录。)
GPT-5.6 用 15 分钟,在一个「不可能有漏洞」的静态网页上找出 13 个问题(08-21 分享会现场演示,配合
OpenAI《The Defender's Window》)
这条的说服力全在样本的选择上:被扫的是 Greg Brockman 本人那个极其古老的纯静态个人主页——没有后端、没有数据库,只是链到一些资源,按常识「几乎不可能有漏洞」。结果 GPT-5.6 分析约
15 分钟给出 13 个问题,包括
DNS 配置可能被用来伪造其邮箱、依赖组件版本存在已知不安全问题、Cloudflare 侧存在未加密的 HTTP 请求。
值得注意的不是数量,是覆盖面的性质变了:模型查的已经不只是页面源码,而是「这个网站的安全边界由哪些东西构成」——DNS、证书、第三方库、CDN 配置,这些传统上要靠人去逐项想起来的面。现场给企业的三条落地建议同样具体:
给安全团队配专属 agent、加载社区开源的安全 skill、优先拿它去扫存量代码的遗留漏洞,并定期做黑客周迭代。⚠️ 该演示与数字出自内部分享会转述,未见公开可核验的原始记录。
「追凶 Neo」:野外第一次抓到成规模运营的攻击型 AI Agent(08-14 · 出自
智谱 GLM-5.3 发布文披露的案例)2026 年 7 月经 FOFA 的 Ferret 引擎,在巴西一台服务器上发现一个名为
Neo 的攻击型 AI Agent:
不到两个月内管理 4 台服务器、7 个域名、6 万个邮箱、100 多个脚本,发出 18,567 封钓鱼邮件,目标为某国会计师事务所与税务机构。
本期 AI 安全格子里的其他条目讲的都是「模型可能被用来攻击」,这条讲的是「已经有人把它拉起来当基础设施跑了两个月」——从能力评估转入运营取证,是完全不同的证据等级。⚠️ 厂商自我披露、未经第三方核验。
评测
GLM-5.3 的横向基准对照表,以及一个「预测第三方评分」的预测(08-14)
把这张表放进来,是因为它正好是故事线 C 在质疑的那个东西本身。社区在 GLM-5.3 发布当天就据此预测它在 Artificial Analysis Intelligence Index 上会落在
58(GLM-5.2 约 51–53),理由是
「代理 + 编码」占该指数权重的 58%,而 GLM-5.3 恰好在这两块接近绝对前沿;当前闭源前沿区间约 61–63。
值得注意的不是这个预测准不准,而是它存在本身——当独立评分机构的出分速度跟不上模型发布速度,社区开始「预测裁判会怎么打分」,这就是计量权真空的日常形态。
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro | Qwen3.8-Max | Opus 4.8 | Fable 5 | GPT-5.6 Sol |
| CODING |
| Terminal-Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 17.4 | — | — | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | — | — |
| ProgramBench | 19.0 | 9.5 | 17.5 | — | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | — | — | 66.5 | 88.2 | — | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | — | — | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | — | — | 32.9 | 41.8 | 36.2 |
| CYBER |
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym(2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | — | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | — | 28.8 | 40.0 | 78.0 | 76.5 |
| AGENTIC |
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam(ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
信源与可信度分层(请按层引用):GLM-5.3 与 GLM-5.2 两列可回溯到
智谱官方技术博客,其中 Terminal-Bench 3.0(4.6→28.3)、DeepSWE v1.1(46.2→66.9)、Agents' Last Exam(23.8→28.5)、GDPval-AA v2(1769)四项与官方口径逐一对上;
⚠️ 其余六列为社区整理的横向对照,本期未取得可引用的原始 URL(读者提供截图,最后编辑时间 08-14 14:05),跨厂商数字未经独立核验,不建议单独引用。而这恰恰是本页反复在说的那件事:
这类表格里的每一个 agentic 分数都内含各家自己 harness 的贡献——OpenAI 本周公布的「两个开关让同一模型分数近乎三倍」已经把这个偏差量化了,所以横着比这张表,比的从来不只是模型。
应用
AI4S
默沙东与 Moderna:individualized 新抗原疗法 intismeran autogene + Keytruda 的 III 期 INTerpath-001 达到 RFS 与 DMFS 终点(
08-19 官方发布 ·
Moderna 同步稿 · NCT05933577)
这是本期最容易被写坏的一条,中文自媒体版本的标题是「人类历史上第一次用 AI 治愈癌症」——该说法不成立,但被它盖住的那个「第一」是真的。先说事实:
1,137 名已完整手术切除的 IIB–IV 期皮肤黑色素瘤患者,2:1 随机、双盲、含安慰剂与活性对照,试验组为 intismeran 1 mg q3w 最多 9 剂 + Keytruda 400 mg q6w 最多 9 周期,对照组单用 Keytruda,约一年(至多 56 周)。技术路径中「每条合成 mRNA 编码
最多 34 个新抗原」是默沙东原文措辞。
关键限定有三层:① 这是「预设的期中分析」达到主要终点 RFS 与关键次要终点 DMFS,官方只说「有统计学意义且有临床意义」,没有公布任何效应量——没有风险比、没有事件率,数据要等后续国际学术会议(分析师指向 10/23–27 的 ESMO);② 总生存期数据仍不成熟,试验还在继续收集;③ 广为流传的「复发或死亡风险降低 49%、远处转移或死亡风险降低 59%」不是这次的结果,而是 IIb 期 KEYNOTE-942 五年随访(ASCO 2026 公布,HR=0.51,95% CI 0.294–0.887;HR=0.411,95% CI 0.200–0.843——注意置信区间很宽,样本小)。为什么「治愈」站不住:这是辅助治疗(adjuvant)读数,所有患者的病灶都已被手术切除,两组都用了 K 药,结论是「加上个体化 mRNA 疗法比单用 K 药更能延缓或阻止复发」。它不治疗现存肿瘤,也还没证明有人因此活得更久。默沙东自己的表述是辅助治疗旨在「增加治愈的可能性」,主要研究者说的是让患者「更长时间保持无癌状态」,双方都没说治愈。
那个真正的第一要窄得多,但依然重要:这是首个取得阳性 III 期结果的个体化新抗原疗法,也是首个成功的 mRNA 癌症治疗方案。市场反应同样值得按原样记:
Moderna 当日 +176.97% 收于 $174.38,为其历史最大单日涨幅,市值约从 250 亿升到 696 亿美元,空头账面损失约 55 亿(S3 Partners);
但次日回吐约 20%——中文转述普遍略去了这一半。(
被修正的中文转述原文)
对 Anthropic 蛋白设计成果的降温式反驳(Ruxandra Teslo)(08-19 · snowflake 解码 01:28Z)
本期最有价值的一条反驳,直接冲着故事线 C 第 11 条去。她援引 @pdhsu 指出:
那些 binder 不是 Claude 设计的,而是由公开的领域专用模型(如 RFdiffusion)设计的,Claude 的角色更接近「非常有用的接口与编排器」(interface and orchestrator)。她顺带梳理了技术谱系:RFdiffusion 2023 年发表,由 RoseTTAFold 改造成扩散模型(对 PDB 实验结构加噪再学重建),与预测结构的 AlphaFold 不同,它能生成新结构、包括针对指定表位的结合体。
最要命的一个参照是:RFdiffusion 原始论文当年就已给出纳摩尔亲和力与 19% 的实验命中率。换句话说,
Anthropic 的 22–35% 该对标的基线可能是 19%,而不是它自己文中用的「行业常规 10–15%」——增量比叙事听起来温和得多,关键蛋白设计模型也已有三到五年历史。(384 赞;被引的 Anthropic 原推 12,214 赞)
放进 AI4S 而不是直接改写故事线 C,是因为两边都还没有第三方裁定——但这恰好就是故事线 C 说的那件事:连「AI 做出了什么科学成果」这个问题,本周也没有独立裁判。
交互界面
ChatGPT 桌面版推出 Computer History:记住你在电脑上跨应用与网站的活动(
⚠️ 跨窗口边界:snowflake 解码
08-13 20:15 UTC = 08-14 04:15 CST,按 UTC 口径超窗约 4 小时、按 CST 口径在窗口首日内;本页其余条目一律用 UTC,故此条
标注保留、不计入窗口内条目数)
它取代的是 Chronicle 研究预览,而替换方式本身是重点:Chronicle 靠截图 + OCR,Computer History 改成读 macOS 无障碍接口暴露的交互事件——点击、输入、快捷键、应用切换。官方给的理由是 token 用量更低、隐私控制更多,
但换掉截图还消掉了一整类风险:屏幕上的内容不再直接进模型上下文,来自页面内容的提示注入面因此收窄。隐私设计是默认关闭、逐项选择哪些应用和网站可贡献、无痕浏览永不采集、菜单栏可随时暂停,
事件文件 48 小时后删除,生成的记忆以本地 Markdown 存放且不用于训练。先发 Pro / Business / Enterprise,EEA、英国、瑞士稍后。
为什么值得记:这是本期「agent 记忆」与「本地数据主权」第一次在消费级产品上正面相撞。对照微软 2024 年 Recall 的隐私风波,OpenAI 这次把三件事全做反了方向——默认关闭、走无障碍 API 而非截屏、事件 48 小时过期。
而它和本期「Google 买下 Spirit 六亿条内部通信」是同一个判断的两端:企业 agent 真正想要的从来不是成品答案,是「一件事到底怎么做成的」全过程记录;区别只在一端从破产资产里买,另一端从你自己的桌面上采。
具身智能
GEN-1.5: Embodied Foundation Models are One-Shot Learners(Generalist AI 官方)(08-19 ·
官方发帖 snowflake 解码 19:40Z)
给它看 3–12 秒的一次演示,它就能学会一个新任务,不做任何梯度更新——演示是作为「physical prompt」进上下文的。模型吃视频/传感器/语言/本体感觉,持 30 秒记忆,输出 100 Hz 动作轨迹;十项测试(开罐子、从钱包里抽钱等)平均成功率
59%,再加 10 步训练、5 分钟数据升到
83%。三种涌现行为更值得注意:
上下文里放两个不同任务的演示,它会把两者串成一个连续技能,并自己补出两段演示里都没有的中间动作(重新定位、重新抓握、错误恢复);纯仿真经验构成的 prompt 能零样本迁移到真机;某些情况下甚至能跨形态——由人用自己的手来做演示。
而公司明确说:没有为促成上下文学习做任何架构改动、没有元学习循环、没有辅助目标,这些能力是在八个多月的交互数据预训练中自己长出来的。他们注意到适配所需的梯度步数一路从数百步降到数十步、最终降到「一分钟数据上的一步」,才去测「干脆不更新会怎样」。官方定性是「机器人学的 GPT-3 时刻」。(
the decoder 独立报道,08-20;公司 6 月以 20 亿估值融资 4 亿美元,Nvidia 与 Bezos Expeditions 参投)
与本期「机器人与端侧」里 Wired 那条并读,答案正好接上:「学一个新任务要多久、要多少示范」这个采购问题,被回答成了「一次演示、几秒钟」。
机器人与端侧
技术栈
智能体
DeepSeek Harness 深度拆解(08-15)238 个可插拔包的完整 agent 运行时、append-only 会话日志,「Agent 时代的 Android」;GitHub 快照 149,467 stars / 15,313 forks(08-18)。
DeepSeek Harness 有了第一个第三方音频插件(08-15 · 让世界充满Ai)DSH 官网 slogan 是「万物皆插件」,作者做了插件队列里的第一个音频插件
dsh-plugin-audiolib(MIT)。
「Android 类比」成不成立,看的就是这类第三方插件能不能长出来——而这篇教程恰好也给出了它目前长到哪一步的答案:DSH 目前只把内置插件的设置下发到浏览器界面,第三方插件的下拉配置项是灰的。生态开放度停在「能装但配不全」。工程细节也顺带暴露了骨架层的耦合有多深:强制 pnpm 管理插件、装完必须重启(
因为插件配置层是在启动时合成的)、凭据统一进
~/.dsh/.credentials.yaml(权限 600)。
与故事线 C 的观察点四(「第一个非 DeepSeek 模型的官方适配」)对照读:生态的第一块砖是第三方插件,而不是第三方模型。
专业编码 · 本轮新点亮
Claude Code v2.1.234 changelog(08-17)release note 里安全条目占绝大多数:全面拒绝 Windows NT namespace 路径以封堵 NTLM 凭证泄漏、MCP 诊断不再打印已解析密钥。
厂商已把「agent 能读到什么路径」当作凭证泄漏问题在治理,而多数使用方还没有。
氛围编程
组织
Scott Gray 离开 OpenAI(08-15 · snowflake 解码 10:06Z)一条五个词的推文冲到约 80 万次浏览。
他没有发正式声明,也没改 LinkedIn——只是把 X 与 Bluesky 简介里的「GPU Geek at @OpenAI」改成了「Former GPU geek at @OpenAI」,并加了一句「目前独立,在探索一些神经启发的 AI 路径」。他不是去竞争对手,也没宣布创业。
为什么这条不是八卦:它给「算力效率」这条线补上了人的维度。社区流传的说法是,OpenAI 的推理 CUDA kernel 长期高度集中在极少数人身上(那条被反复引用的评论说「全世界能为训练写出高性能 CUDA kernel 的人可能不到 100 个」)。
本期反复出现「买不到卡就只能靠调度和 kernel 把效率榨出来」——同一批数字(同集群改调度顺序换来 33 个百分点利用率、纯软件优化榨推理、CPU 侧先到极限)默认了一个前提:有人能写出那层代码。这条提醒的是,那层人才的池子小到单个人的去留就能上热搜。(
36Kr 事件梳理;巧合的是十年前的 08-16,OpenAI 那篇介绍五位新成员的 Team update 里同时有 Scott Gray 和 Dario Amodei)
与本期 CommBench 的 30.7% 并读:模型暂时接不住这层活,而会这层活的人正在变少。
从聊天到组织记忆:Slack 如何搭建真正的人类与 Agent 协作团队(08-20 · Anthropic「人类—Agent 团队」系列第二篇
The Work is the Conversation 中文编译,主角为 Slack 首席产品官 Jaime DeLanghe)核心论点是
对话不会自动变成知识,而 agent 的价值在于能跨讨论记录重建「当初为什么这样决定、之后哪些条件变了」。三条做法:频道默认公开(
agent 只能学它能访问到的内容)、追问理由而不只检索结论、把会议/邮件/日历/文档库都接进上下文。协作模式被明确描述为
「交接」而非自动化——agent 做晨间简报、会前材料、升级事项,人类保留审阅、优先级与最终责任;并主张
给每个 agent 写「岗位说明」,说不清用途的就停用。
最不显然的一点:Slack 把「公开默认」的障碍归到心理安全而不是保密——人躲进私信多半是不想让同事看见没做完的过程,结果 agent 看到的就不是工作真实发生的样子。另一条反指标提醒也有用:
别拿消息数和 token 用量当生产力指标,token 是运行状态而非业务结果——与故事线 C 里「代码行数失效」是同一个病。⚠️ 编译稿无外链,英文原文在 anthropic.com 该系列下。
字节 Seed 在吴永辉之下的组织架构图(读者提供 · ⚠️ 无公开信源、无可核实日期,仅作背景参考,未计入本期条目数)图中架构分五块:Pretrain Data(李成刚)下辖 Text Pretrain(沈科)、Coding Pretrain(Xia Xiao,虚线连唐晟宇)、VLM Pretrain(林毅,虚线连时光)、语音预训练;Horizon RL(唐晟宇)下辖 RL Scaling(岳宇)、Reasoning(王明轩)、VLM RL(吴侑彬,虚线连林毅);Product Posttrain–Work(秦禹嘉)下辖 GUI(吴志勇)与原 Agent 办公合并;Product Posttrain–Chat(朱文佳)下辖豆包和 Dola Chat(严林);另有丁铭(Cybersecurity 等)、钟书(Science)直接汇报,吴迪 → 吴双志负责火山 API 支持。值得留意的是结构本身而非人名:预训练与 RL 之间大量用虚线交叉(Coding Pretrain ↔ Horizon RL、VLM Pretrain ↔ VLM RL),而后训练被明确按「Work / Chat」两类产品切开。这与故事线 C 的技术判断是同一件事的组织投影——当能力增量搬到后训练、且后训练高度依赖具体骨架与场景,组织就会从「一个预训练团队 + 一个对齐团队」裂成「按产品形态分列的多条后训练线」,而预训练退化成给这些线供货的上游。
潜信号
模型厂商开始在 Twitch 上直播自家 Agent 打游戏,「AI 游戏主播」可能是下一个成型的职业位(08-21 分享会现场)OpenAI 在 Twitch 上开了直播,内容是 GPT-5.6 玩《杀戮尖塔》并把它打穿的全过程;此前的先例是 GPT plays Pokémon(用 GPT 打宝可梦红版,全程可回放)。为什么把它放进潜信号而不是当趣闻:这是模型能力展示方式的一次形态变化——从发布会上的静态基准表,变成一段任何人都能实时围观、且无法事后修饰的连续过程。在本期反复讲「基准分不可比、评测缺独立裁判」的背景下,直播恰好提供了一种极土但极难造假的替代性证据:你没法在几万人盯着的实时流里挑样本、调 harness、重跑一遍。现场给出的推论则更远一步——现在的游戏主播都是人,靠边玩边插科打诨与观众互动;而这件事 agent 也能做,且能做得更密集,所以「AI 游戏主播」大概率会成为一个真实职业位。⚠️ 出自内部分享会转述,直播间与场次未取得可引用链接。
市场信号
一个扭转命运的决定:5000 亿智谱如何「逆风改命」(36氪 深氪)(08-20)
本期唯一一份把中国大模型公司的财务与战略拐点摆到台面上的长报道,正好补上故事线 A「中国厂商群体性挤压」缺的第三个样本。拐点一:2025 年 5 月 DeepSeek R1 冲击下约
30% 客户流失,智谱在战略会上放弃垂直模型路线,押注 Reasoning + Coding + Agentic「三合一」,用
15 万亿通用 token + 8 万亿 Coding/Reasoning/Agentic 数据训出 2025 年 7 月的 GLM-4.5。拐点二:2026-06-13 GLM-5.2 拿下 Artificial Analysis 开源 SOTA,
发布后首个交易日股价 +32%,一周内摸到万亿港元市值。财务侧的数字是这条线最硬的部分:
2025 年净亏损 47.18 亿元、研发投入 31.82 亿元(为当年总营收的 4 倍);ARR 从 2026 年 5 月的 5–6 亿美元跃到 7 月的 10 亿美元,
年底预期由 10–15 亿上调到 25 亿美元(智谱未回应)。组织侧:AI 院数百研究员中
70% 以上出自清华计算机系,训练决策被做成 A/B Test 体系,内部标注平台叫「狂标」,并主动砍掉清言/清影等 toC 方向。
最该记的一句是唐杰 08-19 在 X 上把 Scaling Law 重述为「控制变量实验」——对应 GLM-5.3 靠后训练而非堆参数,文中称月之暗面、DeepSeek、阿里近一月发布的旗舰参数量是 GLM-5.3 的 2–4 倍。
这个倍数按总参数算成立(GLM-5.3 基座 753B 对 1.6T–2.8T,约 2.1–3.7 倍),但换成激活参数就只剩 1.2–2.6 倍(40B 对 49B–104B)——而决定服务成本的是后者。⚠️
原文写「参数在 1.6 亿-2.8 亿之间」,按上下文应为万亿量级,系笔误,该处数字勿直接引用;详见
证伪台。全文无外链。
合抱之木,生于毫末!写在 Cursor 被收购之后(08-15 · 字节笔记本)称 SpaceX 已于
08-14 正式完成对 Anysphere 的收购,Cursor 与 Grok Build / Grok Bot / Grok API 打包并入 SpaceXAI。文章更正了一处流传的说法:
Cursor 最早不是浏览器插件,四名 MIT 退学生 2022 年做的是给 CAD 写三维自动补全的机械设计工具,2023 年 4 月才迁到 VSCodium。份额曲线是重点:
市占率一度 41%,Claude Code 以原生 agentic 形态上游下场后,到 2026 年 5 月跌到约 26%,Anthropic 系拿走该品类近一半。结构上这桩交易也不是临时起意——
2026 年 4 月 xAI 就拿到一个期权:年底前可以 600 亿美元收购,或付 10 亿维持合作;SpaceX 是在自己 6 月上市、市值破 2.5 万亿之后才回头行权的。作者的定性值得单独记:这不是溢价故事,是算力议价权的投降——Cursor 长期靠外部模型商供货、自研模型与推理都被卡,真正的对价是 Colossus 那个约百万张 H100 规模的集群。
⚠️ 全文无官方公告、无 SEC 文件,600 亿对价、293 亿估值、41%/26% 份额等数字均无一手出处,引用前需另行核实。
港股 biotech 向何处去?(08-18 · WaveAndParticle)
放进来是给本期 AI4S 那几条做资本市场端的冷水。作者论证港股 biotech 面临「平庸供给大增、需求大幅萎缩」:排队公司 400 多家、其中约 91 家医疗相关且大半是 18A,资产高度同质化,
而最好的公司反而被红筹架构卡住上不了市;需求端三条——中国缺大药企 M&A 这个退出渠道,钱形不成美国式的一二级正循环;今年 6 月 TRS 暂停新开仓后,非沪港通标的只能被美元基金买,
人民币基金那接近一万亿的钱被挡在外面;而真正的美元基金又很少看港股 biotech。对比数据:
美国今年 biotech 上市 21 家、退市+并购 35 家,净 −14 家,并购退出的钱大概率回流二级市场。
最尖锐的是他点出的逆向选择:越是垃圾的公司底线越低、越容易找人做庄进沪港通拿到流动性,认真做科学的公司反被这套规则筛出去。⚠️ 全文为个人观点长文,文中提及的 endpoints 调查未给链接。