三条主线互不重叠,分别从 🤖 持续自主、💱 算力反转、⚠️ 公地溢出 三个维度切入。每条主线包含:① 时间顺序的事件链;② 解释"为什么连起来看"的 So What 段;③ 下周(5/29 EP.87)可追踪的观察点;④ 给开发者 / 决策者 / 投资者的具体建议。
★ 故事线 A · 🤖 持续自主
横跨:智能体 · 应用 · 机器人 · 专业编码 · AI4S · 评测
本周冲击力最强的主线
Agent 进入 "持续自主" 拐点
★ 主线 A |
14 篇时间线 |
1 篇 ★ 重点 |
本期最强冲击力
物理(Figure 24 小时分拣)+ 数学(OpenAI 推翻 Erdős 80 年猜想)+ 软件(LangSmith Engine 自动诊断修复)+ 编程(Code with Claude 50% PR 不审阅)—— 本周四个完全独立的领域同时穿越了"无人干预"的运行门槛。
本周让人意识到一件事:"AI 能不能持续运行"已经不是真问题了;真问题是"我们还在不在审查它做了什么"。Figure Helix-02 连续 24 小时分拣包裹接近人类水平、全程板载推理;OpenAI 内部推理模型自主推翻 1946 年 Erdős 离散几何猜想(独立外部数学家撰写同伴论文验证);LangChain SmithDB + Engine 让生产 trace 自动聚类失败、识别代码问题、提出修复——可观测性变成了自我改进飞轮;最戏剧化的是 Anthropic Code with Claude 伦敦峰会披露:半数 PR 由 Claude 编写、完全未经人工阅读直接合并 。再加上 Karpathy 加入 Anthropic Pre-training,本周这条线像四个独立时钟同时敲响。
§ 1 Chronology · 时间线
★ 本期重点 05-15 🤖
Figure Helix-02:24 小时无人干预自主运行 :Figure AI 展示 Helix-02 连续 24 小时以上自主运行,包裹分拣吞吐量
接近人类水平 ,全程板载推理、零遥操作。从"几分钟演示"到"24 小时持续"是可靠性的质变。包裹分拣是物流行业人力需求最大、环境最标准化的场景,直接商业化价值极高。
本期收尾趋势判断围绕这件事展开。
机器人
05-20 🧮
OpenAI 推理模型自主推翻 80 年未解 Erdős 离散几何猜想 :OpenAI 内部通用推理模型推翻 1946 年平面单位距离问题(Paul Erdős 提出)的主流信念:引入代数数论工具构造无穷族反例,提供多项式级别改进;外部数学家独立撰写同伴论文验证。
不同于"AI 辅助证明",这次完全由通用推理模型自主完成 ——AI 已具备真正的数学创造力,而非仅在人类框架内搜索。
评测/AI4S
05-15 🥇
SU-01:30B 参数达 IMO 2025 / USAMO 2026 金牌水平 :通过反向困惑度课程 SFT + 两阶段 RL 流水线 + 测试时缩放,30B-A3B 参数模型在 IMO、IPhO 等竞赛达到金牌水平,支持超过
100K token 长推理链 。关键突破不在参数规模(30B 并不大),而在训练流水线设计。
基础模型
05-15 🔄
LangChain SmithDB + LangSmith Engine:可观测性变成自我改进飞轮 :SmithDB 是专为 Agent trace 数据设计的数据库;LangSmith Engine 消费 trace,自动聚类失败、识别代码问题并提出修复建议和 evals——
把可观测性变成了持续改进闭环 。AgentOps 从"监控工具"向"自进化基础设施"演进的标志性产品动作。
智能体
05-15 ⚡
Prime Intellect:Claude Opus 4.7 自主搜索 optimizer,接近人类基线 :在 nanoGPT speedrun 基准上,Opus 4.7 达 2930 步、GPT-5.5 达 2950 步,
而人类基线为 2990 步 。经过约 1 万次运行和 1.4 万 H200 GPU 小时。AI 开始自主优化 ML 训练流程本身——如果延续,AI 训练工程师的工作方式将在 12-18 个月内发生根本性变化。
评测
05-21 ⚠️
Anthropic Code with Claude 伦敦峰会:50% PR 不审阅直接合并 :现场披露半数开发者提交的 PR 由 Claude 编写但
完全未经人工阅读直接合并 ;Anthropic 声称 Claude Code 本身的大部分代码由 Claude 编写;新功能
Dreaming 让 Agent 跨任务积累并共享知识。"AI 替代开发者代码审阅"最直接的商业证据——软件工程的"人工质量门"正在消失。
专业编码
05-20 🎯
Claude Code /goal 功能:设定可验证完成条件,AI 持续工作直到达标 :v2.1.139+ 新功能——`/goal` 命令设定完成条件后,Claude 跨多 turn 持续工作直到条件满足。把 Claude Code 从"每次执行一个子任务"变成"自主完成整个项目目标"。
专业编码
05-15 📱
OpenAI Codex 移动端:手机远程监控后台 AI 编程任务 :用户可在 ChatGPT 手机 App 中发起任务、查看输出、批准命令,同时 Codex 在后台运行。同步支持 Remote SSH GA、Hooks。
Codex 从桌面工具变成"可随时随地监控"的 AI 员工 。
专业编码
05-15 🌳
GitHub Copilot App 技术预览:并行工作流 + PR 生命周期管理 :桌面端 Copilot App 支持并行代码流、整个仓库 / PR 生命周期管理。AI 工具正从"补全代码"演进为"管理整个开发过程"的 Agent。
专业编码
专业编码
05-19 🌟
Andrej Karpathy 加入 Anthropic Pre-training 团队 :Karpathy 本人发文确认。
极少数既有顶级研究深度又有大众教育影响力的"两栖型"人才 ——意味着 Claude 系列下一代基础能力获得了最强公众可信度的工程背书;本期"Anthropic 全面超越 OpenAI"叙事最戏剧性的人事注脚。
组织
05-20 🌐
SIMA 2 + Genie + Street View:虚拟世界 Agent 持续运行 :DeepMind SIMA 2 可在 3D 虚拟环境中实时感知、与玩家协作推理;Genie 与 Street View 整合实现对全球真实街道场景的交互式仿真——机器人可在全球数千万条街道的数字孪生中虚拟训练。
具身
05-15 🧪
SDAR:自蒸馏式 Agent 强化学习 :将 On-Policy Self-Distillation 作为门控辅助目标,相对 GRPO 在 ALFWorld +9.4%、Search-QA +7.0%、WebShop +10.2%。Agent RL 训练不稳定性的实用解决方案。
评测/智能体
So What · 为什么连起来看
"持续自主运行"这件事,过去十年都靠演示视频证明。本周第一次,它在四个完全独立的领域同周穿越门槛:
① 物理世界级 :Figure Helix-02 24 小时无人干预 + 接近人类的分拣吞吐——板载推理、零遥操作。 ② 纯数学创造级 :OpenAI 自主推翻 80 年未解 Erdős 猜想,独立外部数学家撰文验证。 ③ 软件 Agent 级 :LangSmith Engine 让生产 trace 自动诊断+修复+评估——可观测性变成自我改进飞轮。 ④ 人类审查崩塌级 :Code with Claude 50% PR 不审阅直接合并;Dreaming 让 Agent 跨任务积累知识。
这条主线最尖锐的判断 :本周开始,对 Agent 的真正考察指标不再是 "AI 能做什么",而是 "哪些事情人类已经停止审查 AI" 。当 Anthropic 自己公开承认 50% PR 不审阅,软件工程的"人工质量门"正在被合法化拆除;当 Karpathy 选择加入 Anthropic Pre-training,创始人级人才用脚投票确认了"自主性"是 2026 H2 的真正战场。
§ 2 Watch Points · 观察点
下期 5/29 EP.87
Figure 是否公布第二个无人干预场景(仓库/工厂以外)+ 物流公司试点签约信号
2 期 6/05 EP.88
Anthropic 是否在 IPO 招股书 / model card 中披露"AI 编写 / 不审阅"比例
4 期 6/19
OpenAI 是否公开 Erdős 反例工作的完整流水线 + 进入数学预印本平台
中长期 Q3
是否出现"持续自主 Agent + 真实事故"的首个公开案例(最早预警信号)
§ 3 Practical · 明天能用
For Decision-Makers
决策者
最重要的战略动作:把"
AI 不审查比例 "纳入 KPI——参考
Anthropic 50% PR 不审阅 ,评估你的工程团队哪些代码路径(测试 / 文档 / 数据迁移 / 工具脚本)可从"必审"切到"抽审"。同时立即评估
Figure Helix 类持续自主物理 Agent 对你所在行业的替代风险(物流 / 仓储 / 零售 / 制造首当其冲)。
For Investors
投资者
"持续自主"赛道的资本定锚:
Figure (物理)+
LangChain (软件)+
Exa (搜索)正在拉高估值;同时关注"
AI Agent 失败率验证 "赛道——这是与"自主性"反向对冲的稀缺资产。
★ 故事线 B · 💱 算力反转
横跨:AI Infra · 市场信号 · 观点洞察 · 组织
本期最反直觉的商业反转
算力市场的 "竞合" 反转
★ 主线 B |
12 篇时间线 |
1 篇 ★ 重点 |
本期最戏剧反转
Anthropic 月付 xAI $12.5 亿至 2029 年 购买 Colossus 算力(昔日竞争对手转型供应商)+ 同时与微软洽谈租用 Maia 200 自研芯片(脱 NVIDIA 信号)+ OpenAI-微软独家协议正式解绑 + 数据中心租约 15 月飙 220% —— 算力市场的所有"独家锁定"叙事同周崩塌。
本周 AI 算力市场出现了它历史上最戏剧的两个反转。第一个:Anthropic 将每月向 Elon Musk 的 xAI 支付 12.5 亿美元购买算力,合同锁定至 2029 年 5 月 ——Musk 此前是 OpenAI/Anthropic 的公开批评者,如今成为后者核心算力供应商。第二个:Anthropic 同时洽谈租用 Azure Maia 200 自研芯片 ——首个重量级"脱 NVIDIA"客户。再加上 OpenAI-微软独家解绑、五大科技公司数据中心租约 15 月飙至 $8220 亿(+220%)、马里兰居民被迫承担 $20 亿 AI 电网账单——整个市场告诉你:商业逻辑已经凌驾于公司价值观之上。
§ 1 Chronology · 时间线
★ 本期重点 05-20 💱
Anthropic 月付 xAI $12.5 亿购买算力——竞争对手变供应商 :Elon Musk 的 xAI 向 Anthropic 出售算力,
月费高达 12.5 亿美元 。Musk 曾是 OpenAI/Anthropic 的公开批评者,如今成为后者核心算力供应商,
商业利益超越公司价值观分歧 。每月 12.5 亿意味着 xAI 算力收入远超 Grok 产品收入。
本周最具戏剧性的商业反转——本期收尾趋势判断围绕这件事展开。
市场信号/AI Infra
05-22 📊
Epoch AI:前沿实验室算力仅占全球 30%,Anthropic-Colossus 合同锁定至 2029 年 :OpenAI、Anthropic、xAI 三家前沿实验室算力可能
不足全球 AI 算力总量的 30% ,Google 和 Meta 占绝对算力主导;Anthropic-SpaceX/Colossus 合同
$12.5 亿/月至 2029 年 5 月 。重新定义了 AI 竞争中的"算力版图"——公众叙事聚焦 OpenAI/Anthropic 算力争夺,但 Google/Meta 几乎不被计入。
AI Infra
05-21 🔌
Anthropic 洽谈租用 Azure Maia 200 自研芯片 :Anthropic 考虑在 Azure 上租用 Maia 200 推理芯片(TSMC 3nm、HBM)。若达成,将是迄今
最大规模的"脱 NVIDIA"信号之一 ;对微软:Maia 200 首个重量级外部客户将大幅提升自研芯片的商业化可信度。
AI Infra/市场信号
05-17 🔓
OpenAI 与微软正式"解绑" :微软 130 亿美元投资已产生 300 亿+ 收入回报,OpenAI 是 Azure AI 最大客户(贡献约 60%),但
双方关系从独家走向开放 。OpenAI 可能在 AWS/GCP 上提供服务,对 Google Cloud(Anthropic 战略投资方)是利好。
观点洞察
05-18 📈
五大科技公司数据中心租约 15 月飙升 220% 至 $8220 亿 :微软、亚马逊、谷歌、Meta、甲骨文"未开始的数据中心租约承诺"从 $2570 亿激增至 $8220 亿。
AI 基础设施军备竞赛不仅未见顶 ,实际建设速度甚至落后于承诺速度。
市场信号
05-20 ⚡
美国最大电网加速推进数据中心能源计划 :AI 对电力基础设施的压力从"预期"
正式转变为"排期" ,公用电力股全面上涨。电力、输配电、冷却设备正成为 AI 算力产业链的新核心环节。
AI Infra
05-19 📉
马里兰居民被迫承担 $20 亿 AI 电网升级账单 :马里兰州普通纳税人承担 20 亿美元电网升级费用以支持
州外 AI 数据中心运营,已向 FERC 投诉。AI 数据中心外部成本正从"地方讨论"变成"联邦监管议题"。
潜信号/Cost
05-20 💎
黄仁勋发现 $2000 亿新市场 + NVIDIA 持初创股权 $430 亿 :黄仁勋指向 AI 基础设施扩张和物理 AI 作为 NVIDIA 下一增长引擎;首次披露持有初创公司股权高达
430 亿美元 (含 OpenAI、Anthropic、Cohere 等)。NVIDIA 从"GPU 卖家"进化为"AI 产业链股权投资者"。
市场信号
05-18 🏆
Anthropic 估值首次超越 OpenAI:$1.2 万亿 vs OpenAI $8800 亿 :Q1 2026 年营收 ARR 同比 80 倍增长、$39B 年化营收、Fortune 500 大多数公司成为客户。"OpenAI 是 AI 行业代名词"的时代正在结束。
市场信号
05-21 💰
Anthropic Q2 2026 首次经营利润 $5.59 亿 :Q2 年化收入从 48 亿跃升至 109 亿(+127%),预期实现史上首个经营利润季度。P/S 约 27 倍——已有收入支撑。
市场信号
05-20 🚀
OpenAI 提交保密 IPO 招股书,9 月上市,估值剑指万亿 :高盛 + 摩根士丹利联合承销,目标 9 月敲钟;恰在 Musk 诉讼败诉次日。AI 行业进入"
超级 IPO 窗口 "。
市场信号
05-18 🇨🇳
中国 AI 实验室在出口限制下形成"效率护城河" :被算力限制倒逼出的极致效率优势正在形成西方难以复制的竞争壁垒;本周 Kimi K2.6 在代码基准首次超越 GPT-5.4 和 Claude Opus 4.6;书生 Intern-S2-Preview 35B 参数比肩万亿模型。
效率基因已植入 ——重新定义出口管制的战略逻辑。
观点洞察
So What · 为什么连起来看
本周算力市场的所有"独家叙事"同周崩塌——这是 12 个月前不可想象的:
① 价值观让位商业 :Musk 一年前在公开骂 Anthropic,本周开始每月收 12.5 亿美元服务这家公司,合同锁到 2029。 ② NVIDIA 独家锁定也在松动 :Anthropic 洽谈租用微软 Maia 200——首个重量级"脱 NVIDIA"客户;黄仁勋公布 $430 亿初创股权(自己变投资人)。 ③ OpenAI-微软独家协议正式终结 :OpenAI 可上 AWS/GCP,微软可接 Anthropic / Maia。 ④ 算力地基持续抬升 :数据中心租约 15 月 +220% 至 $8220 亿;美国最大电网从"预期"切到"排期"。
这条主线最尖锐的判断 :本周开始,AI 算力市场进入"商品化成熟期 "——所有"独家锁定 + 战略联盟"的护城河叙事都会被商业逻辑碾平。Anthropic 月付 xAI $12.5 亿这件事告诉所有人:在 AI 算力面前,没有永远的敌人,只有永远的合同 。
§ 2 Watch Points · 观察点
下期 5/29 EP.87
xAI 是否公布首批 Colossus Anthropic 算力上线进度 / Maia 200 谈判是否进入实质性条款披露
2 期 6/05
OpenAI 是否官方宣布在 AWS 或 GCP 提供 API 服务(独家解绑的具体落地)
4 期 6/19
OpenAI IPO 招股书披露细节 + Anthropic 是否启动 IPO 流程
中长期 Q3
数据中心选址监管立法(FERC / 各州 / 中国 / 欧盟)是否首批出台 + AI 用水强制申报
§ 3 Practical · 明天能用
For Investors
投资者
"算力商品化"三条投资线:①
NVIDIA 替代芯片 (Cerebras IPO + SiMa.ai $14B + Anthropic 试水 Maia 200);②
数据中心基础设施 (电力、冷却、REIT);③
开源前沿模型 (Kimi K2.6、Cohere Command A+)作为 API 定价权下行的对冲。同时警惕:
债券市场已对 AI 通胀影响定价 。
★ 故事线 C · ⚠️ 公地溢出
横跨:AI 安全 · 观点洞察 · 应用 · 潜信号
开源/学术/安全/公众信任/创意劳动 同周受冲击
AI 在 公共基础设施 上的"溢出"
★ 主线 C |
10 篇时间线 |
1 篇 ★ 重点 |
本期最广战线
Linus Torvalds 痛斥 Linux 安全列表被 AI 漏洞淹没"几乎无法管理" + arXiv 对 LLM 幻觉论文 1 年禁令 + Pwn2Own Berlin 所有 AI 编程工具被沙箱逃逸 + Google 向开放 Web 宣战 + 美国大学毕业典礼学生集体嘘 AI 演讲 + 美国公众民调系统性反 AI。
本周让人警觉的,是 AI 在它没准备好的地方"溢出"了 ——溢出到 Linus Torvalds 的 Linux 安全邮件列表,让他公开宣布"几乎无法管理";溢出到 arXiv 学术预印本平台,迫使其对 LLM 幻觉论文实施 1 年提交禁令;溢出到 Pwn2Own Berlin 的赛场,所有主流 AI 编程工具全部被沙箱逃逸;溢出到 Google 搜索框,整个开放 Web 的链接经济被宣战;溢出到美国大学毕业典礼,学生用嘘声打断对 AI 的正面演讲。这不是某一个领域的局部问题——是 AI 在公共基础设施上"承载力同时被突破 "的星期。
§ 1 Chronology · 五个领域同周溢出
★ 本期重点 05-18 🐧
Linus Torvalds:Linux 安全邮件列表被 AI 漏洞报告淹没"几乎无法管理" :AI 驱动的漏洞扫描工具大量生成低质量安全报告,导致 Linux 安全邮件列表
信噪比崩溃 。继 RPCS3 / Godot AI PR 泛滥后,AI 生成内容冲击开源基础设施的
最高量级案例 。Linux 内核安全是全球基础设施的核心护栏——如果 AI 噪声导致真实漏洞淹没在误报中,意味着全球最关键的软件安全流程面临新型风险。
AI 安全
05-17 📚
arXiv 对含 LLM 幻觉的论文实施 1 年提交禁令 :严厉措施:1 年提交禁令,强调所有作者对论文内容负全责。
学术界对"AI 生成学术垃圾"容忍极限的集体信号 ——arXiv 是 AI 研究的主要预印本平台,其政策转变将直接影响 AI 研究的发表和可信度审查方式。
AI 安全/学术
05-18 🔓
Pwn2Own Berlin 2026:所有主流 AI 编程工具被沙箱逃逸 :Cursor / LM Studio / Codex / Claude Code 全部成为攻击目标——六支研究团队联合演示沙箱逃逸技术,核心攻击向量是凭据(credentials)而非模型本身。"IAM 看不到"意味着现有安全监控框架尚未覆盖 AI Agent 行为。
AI 安全
05-20 🌐
Google 正在向开放 Web 宣战:I/O 2026 AI 搜索策略 :HN 194 分热讨——AI 直接给出答案意味着用户不再点击来源网站,
整个 Web 经济的激励结构正在崩塌 。搜索驱动约 40% 的 Web 流量;当 AI 成为信息最终消费终点而非分发入口,媒体 / 博客 / 专业内容站的商业模式面临结构性挑战。
应用/观点洞察
05-20 🎓
美国多所高校毕业典礼:学生集体嘘声抗议 AI 赞美演讲 :演讲者对 AI 正面表述遭学生集体嘘声抵制,一位演讲者回击"Deal with it"。
当科技圈内部还在讨论 AI 带来的生产力飞跃时,最直接面对就业市场的年轻世代已经开始公开表达抵制 。
潜信号/Labor
05-20 📉
AI 热潮正在失去美国公众信任:多项民调同步逆转 :The Algorithmic Bridge 汇编迄今最全面的美国民众 AI 态度数据集——皮尤、盖洛普、哈里斯民调无论问题措辞和采样方法如何差异,
结论高度一致:美国公众对 AI 态度系统性转负 。AI 监管立法的政治可行性随之上升。
观点洞察
05-20 👁
Google 悄悄应对针对 AI 搜索结果的操控攻击 :恶意方通过投毒训练数据、注入 prompt 等手段影响 AI 搜索输出。当用于战略分析的 AI 搜索结果本身可能被恶意操控,
信息安全的边界从"数据层"延伸到了"模型输出层" 。
AI 安全/应用
05-21 🌏
毛利语 TTS 模型:拒绝大型科技公司,优先社区主权 :新西兰毛利语 TTS 模型开发者
拒绝了 Google/Microsoft/Amazon 的合作和数据采购条件 ,坚持以社区数据主权和文化价值为第一优先级——不对外开放 API,不接受平台托管。"语言数据主权"将成为 AI 治理新热点。
潜信号/治理
05-19 💧
乔治亚州 AI 数据中心 15 个月秘密抽取 2900 万加仑水 :未申报情况下消耗 2900 万加仑水,直到居民因水压异常低才被发现;地方官员最终拒绝罚款——AI 基础设施扩张中
监管缺失的极端案例 。
潜信号/治理
05-20 🛡️
白宫 AI 安全行政令草案:90 天预发布审查窗口 :AI 公司自愿在发布前 90 天将模型提交政府审查(OpenAI/Anthropic 倾向 14 天);财政部牵头建立 AI 安全漏洞清除机制。
美国首个正式前沿 AI 模型"预发布政府审查"框架 。
治理
So What · 为什么连起来看
本周这 10 条事件分别属于完全不同的社区——Linux 内核维护者、arXiv 学术管理员、Pwn2Own 安全研究员、Web 内容生态、美国大学生、毛利语社区、乔治亚州居民——但他们同周做了同一件事:明确告诉 AI 行业"你已经溢出了" 。
① 承载力被突破的不是技术,是公共基础设施的"维护成本" ——Linus 不是说 AI 没用,他说 AI 报告的信噪比已经超过人工审阅能力 ;arXiv 不是禁 AI,而是把"作者责任"作为反制 ;Google 搜索也没坏,但Web 的激励链路被截断 。 ② 溢出有方向性 :AI 主要溢出到"维护型"工作 (漏洞审阅、论文同行评议、内容审核),而不是"创造型"工作 。这与故事线 A 形成反讽对照:A 主线展示 AI 在"创造"上拐点;C 主线显示 AI 在"维护"上失控。 ③ 政治回应同步出现 :白宫行政令 + 美国民调反转 + 学生嘘声 + 毛利语主权 + 马里兰/乔治亚州抗议——AI 行业的"社会许可证"正在以多个独立路径同步收紧。
这条线最具体的判断 :2026 H2 的最大监管风险不是"前沿 AI 太强",而是"维护型 AI 太烂"——立法者会从 Linus / arXiv / Pwn2Own 的具体痛点切入,而不是从哲学层面争论 AGI。
§ 2 Watch Points · 观察点
下期 5/29 EP.87
arXiv 1 年禁令是否被其他平台跟进(OpenReview / SSRN / bioRxiv);Linux 基金会是否发"AI 漏洞报告规范"草案
2 期 6/05
白宫 AI 行政令是否正式签署 + 90 天预审标准是否被压回 14 天
4 期 6/19
Google 是否回应"向开放 Web 宣战"批评 + 是否调整 AI Overview 源站点引流机制
中长期 Q3
是否出现"AI 数据中心被州政府否决"的具体案例(继马里兰投诉、乔治亚拒罚之后)
§ 3 Practical · 明天能用
For Decision-Makers
决策者
把"
AI 输出的下游接收方是否有承载力 "作为 AI 项目设计第一原则——别让你的 AI 客服把工单数翻 10 倍而人工还在审;别让 AI SEO 把内容稿件量翻 100 倍而读者无法消费。同时立即评估
AI 搜索操控攻击 对你战略情报来源的污染风险。