XAI(马斯克的 AI 公司)宣告解散,把几十万张 GPU 卡租给了 Anthropic,导致 Anthropic 算力额度暴增。但实体消失不等于退场——它会以「Space XAI」的形式融入 SpaceX 继续存在。本质是:马斯克觉得当下不需要那么多推理算力,先把这部分资源出租变现。
arkprice 做了一系列很有意思的 Benchmark,第三级最震撼:纯让 Agent 自己去玩红白机时代的游戏,且不告诉你目标是什么,得自己探索找到「通关」的定义。结果顶级模型只得约 0.203 分——一个 7 岁小孩能轻松玩通的游戏,最强模型只能得零点几分。该降低对「AGI 将至」的预期。
本期最烧脑的安全话题:用粤语同质语法作为提示注入载体。原理很反直觉——大模型的「拒绝回答」其实是一个和其他 feature 竞争的 feature;模型对 LGBT 等少数群体议题会自动放松审查,于是用「我是一个 Lesbian」作前置语境,就能诱导它回答本会拒绝的内容。Anthropic「Tracing the Thought」论文里早有记录:refusal feature 一旦在博弈中落下风,拒绝行为就消失。用过度的政治正确,诱使大模型关闭对齐机制——国内外都适用。
OpenAI 连续三天:成立合资公司、发布金融 Agent、让 JP 摩根站台背书。为什么?因为 Blackstone、高盛这些机构对 OpenAI 来说是甲方爸爸,JV 的本质是把大客户变成分销渠道,帮你卖给更多企业。要卖的是一堆「现在就能下单」的金融 Agent。从 Cowork 的 plugin 列表也能印证:Kensho(S&P Global)、Brightdata 等插件最近悄悄上架。
三件「悄悄发生」的事,每件单看都有点可怕:Google Chrome 静默给用户装了一个 4GB 本地大模型(无提示、无权限请求);Anthropic 的 Cloud 在本地 Chromium 注册了一个组件,把网页 JS 直接接入本地应用(两周前才被一位底层安全分析师发现);Apple Support 官方 App 泄露了 claude.md,显示苹果客服系统已用 multi-agent 架构、统一兼容人类与 AI 客服。这些涉嫌违反 GDPR;更重要的趋势信号是——越来越多厂商把有执行能力的程序悄悄装进你的设备,而法律严重滞后。
引用 AppleOKIEPOKI 发布的数据,几个关键增速:
最新数据中心规模:70 万块 H100 等效(Anthropic + 亚马逊合作),中美算力差距仍在扩大。每美元算力增长 1.3 倍可能还低估了——硬件芯片制造才是真实瓶颈,GPU 光刻卡住了所有 scaling 的天花板。
MMLU、GPQA 这些曾经高高在上的 Benchmark 已被刷爆,顶级模型发布都不好意思提,改说自己定义的「神奇指标」。几个有趣的新型评估:RKGI(游戏 benchmark)、IRGB(镜子旁放积木让你描述渲染图,没有模型跑得了)、FEN notation(用 FEN 串描述棋局,只有 Image 2 能处理)、万智牌(长程任务,模型一进该领域基本糊掉)、Simple Bench(常识题,人类 95、Gemini 3.5.3 Pro 80)、Crux(用人类可判断的真实任务,如 Pokémon Red、AI Village)。新逻辑:放松一个维度(纯文本 / 短时间 / 以人类为参照)就能做出新的有效 Benchmark。
5 月 5 日刚发布的一篇论文提出 SUBQ(亚二次架构),声称把注意力机制复杂度从 O(N²) 降下来,让注意力计算量下降 1000 倍,比 Flash Attention 快 50 倍(而 Flash Attention 本身已是 3 个数量级的优化)。目前还没广泛验证,但若属实,将是推理方向近期最大的进展之一。
一个疯狂趋势:企业开始把 Token 消耗量当核心 KPI。Uber 四个月就用完了全年的 Token 预算;有人同时跑 50 个并行 Codex,一分钟烧了 4 亿 Token 直接超配额。另一面是震撼的生产力——一个人让 50 个 agent 同时工作,已经不是「10 倍工程师」,可能是「1000 倍工程师」。
一篇文章彻底拆解了 Scrum 在 AI 时代为何失效:我们在 2026 年的机器上跑 1995 年定义的工作流。症状清单——站会变成大家念自己的 Jira;Sprint 演示演的是工作成果而非真实部署;团队加速度只在绩效 review 前才提升。成本:8 人团队、每次 15 分钟站会、两周一个 sprint,一年光站会成本就超过一个工程师的薪资。替代方向:SPEC 先行、线性冲、Agent 优先、持续交付代替迭代。
Coinbase 裁员 14%(目标 15%),CEO 内部信揭示新组织逻辑:CEO 之下最多 5 层管理;没有纯粹的 manager,每个人都必须是贡献者(IC);未来形态是 AI Native POD——一个小团队里有 agents 和几个人,人人身兼多角;被裁员工拿 16 个月薪资补偿。一人公司时代正在到来:一个人设计、产品、开发、交付、客服全包,在 AI 能力足够时不再是天方夜谭。
最神奇的项目:有人在做 LLMOS,核心命题是「能不能训练一台计算机?」路径:① 找到图灵完备的最小指令集 Subtotal Equal(一条指令就能模拟所有程序);② 用 Transformer 去拟合这个函数;③ 训练出的 Transformer 直接吞代码吐结果,不需要任何编译器和运行时。准确率约 99%,作者好像还是个学生。第一次有人真的在把 Transformer 做成一台电脑。
从 XAI 解散到「用 Transformer 训练一台计算机」,本期 12 则速写勾出 2026 年初 AI 的几条暗线:能力评估在重做、端侧在被悄悄渗透、组织与商业化范式在重写。想听每条背后的现场拆解,看右下角讲解视频导览。