每周 AI 情报 · 速览版
CIT Update 2026-05-08
AI Buzzwords · Weekly Signal

第 84 期

约 67 分钟
主讲 · 冯小平
Benchmark 已死 · LLMOS 的曙光 · 端侧渗透 · 商业化新范式 · 敏捷消亡 · 架构突破
本期速写EP.84 · 12 则
这一期像一个「AI 新闻速写本」——XAI 解散、Chrome 偷偷装了个 4GB 大模型、Benchmark 集体宣告死亡、Scrum 被写成悼词、Coinbase 裁员 14% 却说这是「好事」……每一条单独拎出来都能聊半小时12 则速览 · 3 句金句 · 15 个关键词 · 整理自录音转录,以原音频为准
· · ·
01市场

🪦XAI 解散了,但别高兴太早

XAI(马斯克的 AI 公司)宣告解散,把几十万张 GPU 卡租给了 Anthropic,导致 Anthropic 算力额度暴增。但实体消失不等于退场——它会以「Space XAI」的形式融入 SpaceX 继续存在。本质是:马斯克觉得当下不需要那么多推理算力,先把这部分资源出租变现

为何值得听原音:对这件事背后资本运作逻辑的拆解,远不止「解散了」三个字。
02评测

🎮RKGI Benchmark:AI 连 7 岁小孩都不如

arkprice 做了一系列很有意思的 Benchmark,第三级最震撼:纯让 Agent 自己去玩红白机时代的游戏,且不告诉你目标是什么,得自己探索找到「通关」的定义。结果顶级模型只得约 0.203 分——一个 7 岁小孩能轻松玩通的游戏,最强模型只能得零点几分。该降低对「AGI 将至」的预期。

03AI 安全

🏳️‍🌈「Gay Geo Break」:用政治正确绕过对齐

本期最烧脑的安全话题:用粤语同质语法作为提示注入载体。原理很反直觉——大模型的「拒绝回答」其实是一个和其他 feature 竞争的 feature;模型对 LGBT 等少数群体议题会自动放松审查,于是用「我是一个 Lesbian」作前置语境,就能诱导它回答本会拒绝的内容。Anthropic「Tracing the Thought」论文里早有记录:refusal feature 一旦在博弈中落下风,拒绝行为就消失。用过度的政治正确,诱使大模型关闭对齐机制——国内外都适用。

04商业化

💼OpenAI + 金融巨头组 JV:这不是合作,是销售渠道

OpenAI 连续三天:成立合资公司、发布金融 Agent、让 JP 摩根站台背书。为什么?因为 Blackstone、高盛这些机构对 OpenAI 来说是甲方爸爸,JV 的本质是把大客户变成分销渠道,帮你卖给更多企业。要卖的是一堆「现在就能下单」的金融 Agent。从 Cowork 的 plugin 列表也能印证:Kensho(S&P Global)、Brightdata 等插件最近悄悄上架。

一句话:一级市场讲故事,二级市场赚利润,PE 内部套利——结构精辟。
05潜信号

🕵️Chrome 悄悄装了 4GB 模型,Anthropic 也悄悄装了个组件

三件「悄悄发生」的事,每件单看都有点可怕:Google Chrome 静默给用户装了一个 4GB 本地大模型(无提示、无权限请求);Anthropic 的 Cloud 在本地 Chromium 注册了一个组件,把网页 JS 直接接入本地应用(两周前才被一位底层安全分析师发现);Apple Support 官方 App 泄露了 claude.md,显示苹果客服系统已用 multi-agent 架构、统一兼容人类与 AI 客服。这些涉嫌违反 GDPR;更重要的趋势信号是——越来越多厂商把有执行能力的程序悄悄装进你的设备,而法律严重滞后。

06AI 基础设施

📉每年推理成本下降 40 倍,但硬件还是瓶颈

引用 AppleOKIEPOKI 发布的数据,几个关键增速:

↓40×/年
推理成本
↑5×/年
训练算力
↑1.3×/年
每美元 FLOPS
↑3×/年
预训练软件效率

最新数据中心规模:70 万块 H100 等效(Anthropic + 亚马逊合作),中美算力差距仍在扩大。每美元算力增长 1.3 倍可能还低估了——硬件芯片制造才是真实瓶颈,GPU 光刻卡住了所有 scaling 的天花板

07评测

🪦传统 Benchmark 已死,新一代评估怎么做

MMLU、GPQA 这些曾经高高在上的 Benchmark 已被刷爆,顶级模型发布都不好意思提,改说自己定义的「神奇指标」。几个有趣的新型评估:RKGI(游戏 benchmark)、IRGB(镜子旁放积木让你描述渲染图,没有模型跑得了)、FEN notation(用 FEN 串描述棋局,只有 Image 2 能处理)、万智牌(长程任务,模型一进该领域基本糊掉)、Simple Bench(常识题,人类 95、Gemini 3.5.3 Pro 80)、Crux(用人类可判断的真实任务,如 Pokémon Red、AI Village)。新逻辑:放松一个维度(纯文本 / 短时间 / 以人类为参照)就能做出新的有效 Benchmark

08架构

SUBQ 架构:注意力计算降低 1000 倍?

5 月 5 日刚发布的一篇论文提出 SUBQ(亚二次架构),声称把注意力机制复杂度从 O(N²) 降下来,让注意力计算量下降 1000 倍,比 Flash Attention 快 50 倍(而 Flash Attention 本身已是 3 个数量级的优化)。目前还没广泛验证,但若属实,将是推理方向近期最大的进展之一。

09智能体

💸Token 消耗成 KPI,Uber 四个月烧完一年预算

一个疯狂趋势:企业开始把 Token 消耗量当核心 KPI。Uber 四个月就用完了全年的 Token 预算;有人同时跑 50 个并行 Codex,一分钟烧了 4 亿 Token 直接超配额。另一面是震撼的生产力——一个人让 50 个 agent 同时工作,已经不是「10 倍工程师」,可能是「1000 倍工程师」

10组织

🔨Scrum 已死:2026 年的机器跑着 1995 年的流程

一篇文章彻底拆解了 Scrum 在 AI 时代为何失效:我们在 2026 年的机器上跑 1995 年定义的工作流。症状清单——站会变成大家念自己的 Jira;Sprint 演示演的是工作成果而非真实部署;团队加速度只在绩效 review 前才提升。成本:8 人团队、每次 15 分钟站会、两周一个 sprint,一年光站会成本就超过一个工程师的薪资。替代方向:SPEC 先行、线性冲、Agent 优先、持续交付代替迭代

11组织

🪓Coinbase 裁员 14%:纯 manager 是最危险的职位

Coinbase 裁员 14%(目标 15%),CEO 内部信揭示新组织逻辑:CEO 之下最多 5 层管理;没有纯粹的 manager,每个人都必须是贡献者(IC);未来形态是 AI Native POD——一个小团队里有 agents 和几个人,人人身兼多角;被裁员工拿 16 个月薪资补偿。一人公司时代正在到来:一个人设计、产品、开发、交付、客服全包,在 AI 能力足够时不再是天方夜谭。

12彩蛋

🧠用 Transformer 训练一台计算机

最神奇的项目:有人在做 LLMOS,核心命题是「能不能训练一台计算机?」路径:① 找到图灵完备的最小指令集 Subtotal Equal(一条指令就能模拟所有程序);② 用 Transformer 去拟合这个函数;③ 训练出的 Transformer 直接吞代码吐结果,不需要任何编译器和运行时。准确率约 99%,作者好像还是个学生。第一次有人真的在把 Transformer 做成一台电脑。

✦ ✦ ✦
「你给所有人的浏览器里装了个 4B 的模型,全球二氧化碳排放的骤增……他直接说到这了。」
—— 讽刺某安全研究员的奇特担忧
「咱们现在在 2026 年的机器上跑 1995 年的流程。」
—— 论 Scrum 的时代错位
「一个人可以同时是 PM、做产品、做开发、做客服——都能做。」
—— 论一人公司
XAI 解散RKGI BenchmarkGay Geo BreakOpenAI JVAnthropic Chrome 组件Apple claude.md 泄露SUBQ 架构LLMOSCrux 项目万智牌 BenchmarkSimple BenchCoinbase 裁员Scrum 已死FEN notationAppleOKIEPOKI 数据

EP.84 · 速览版

从 XAI 解散到「用 Transformer 训练一台计算机」,本期 12 则速写勾出 2026 年初 AI 的几条暗线:能力评估在重做、端侧在被悄悄渗透、组织与商业化范式在重写。想听每条背后的现场拆解,看右下角讲解视频导览。

AI Buzzwords · CIT Update · 2026-05-08
AI 解释
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾