DEEPDIVE / [STORYLINE] · 六个下注
SL·02 · v1 · 2026 · AUG
Storyline №02 · 7 篇,一条叙事

六个下注:
新一代 AI 实验室的赌局与看不见的代价

过去几个月,至少六家新实验室分别拿到数十万到数十亿美元融资,却押在了完全不同的东西上——一种全新的组织形态、一份还没验证的技术信条、一句言行不一的承诺,乃至一个人过去的战绩。这篇导读把 NEO LAB 系列六篇案例报告和一篇附录串成一条叙事线:从最小的一注(50 万美元、真实运营的自动售货机)到最大的一注(51 亿美元估值、零产品),再到最后,看一眼当这些赌注真正落地,谁会替看不见的差距买单。

7 篇
串联的 NEO LAB 深潜
六篇案例 + 一篇附录
160 亿+
美元 · 五起融资对外
披露估值合计
13%
Vending-Bench 2 顶尖模型
达到的人类上限比例
70%
同一件商品 · 弱模型代理
vs 强模型代理的价差
Route · 本条故事线的七站
  1. Andon Labs第一幕 · 押注一种组织形态
  2. Ineffable Intelligence第二幕 · 押注一份信条(一)
  3. AMI Labs第二幕 · 押注一份信条(二)
  4. Recursive Superintelligence第三幕 · 言行的落差(一)
  5. Prime Intellect第三幕 · 言行的落差(二)
  6. 卜拉格(未官宣)第四幕 · 押注一个人
  7. Project Deal终幕 · 看不见的代价
TL;DR · 30 秒
过去几个月,至少六个新实验室各自拿到数十万到数十亿美元,分别押注一种全新组织形态、一份未经验证的技术信条、一句言行不一的承诺,或者干脆押注一个人的过往战绩——而当这些赌注真正落地时,谁在真正承担代价,往往悄无声息。
  • Andon Labs 用不到 50 万美元融资、8~9 人团队,把真实的钱和租约交给 AI 经营,并像药厂报告不良反应一样主动披露失败——Vending-Bench 2 上最强模型也只做到人类上限的约 13%(Andon Labs
  • David Silver 押 11 亿美元融资 / 51 亿美元估值,赌一个"扔掉人类数据"的超学习者;公司截至目前没有产品、没有路线图(Ineffable Intelligence
  • Yann LeCun 押 10.3 亿美元融资 / 35 亿美元投前估值,赌 JEPA 世界模型能替代 LLM,公开断言 LLM 在机器人领域"基本没用"(AMI Labs
  • Richard Socher 的公司宣称要"用算法而非蛮力算力实现递归自我改进",三个月后却签下 4.1 亿美元 AWS 算力协议,用掉了融资的大部分(Recursive Superintelligence
  • Prime Intellect 用 INTELLECT-1、2 证明了去中心化训练可行,但它真正的旗舰模型 INTELLECT-3,却诞生在 512 张 H200 的一间机房里(Prime Intellect
  • 通义千问技术负责人林俊旸一条八个单词的推特辞职后,工商信息与媒体报道替他拼出一家 20 亿美元估值的公司——他本人从未确认过这个公司名字(卜拉格
  • Anthropic 自己的实验发现:同一件商品,用弱模型代理的人客观上多付 70%,但主观感受到的公平度和用强模型代理的人几乎完全一样(Project Deal
反共识 · Anti-Consensus这些赌局公开叫卖的都是"技术信条"——自主组织、超学习者、JEPA、开放式演化、去中心化训练——但真正被定价的,始终是发起者过去的战绩:资本买的是"一个人被允许失败四五年"的信誉期权,而不是已经跑通的答案。等到答案真正落地时,率先显形的代价,往往不是下注者本人承担,而是那些甚至不知道自己正在用弱模型的普通用户。
序幕 / 00

这半年的七篇报道,
讲的其实是同一件事:押注

单独看,它们是七件互不相干的新闻:一家用 50 万美元运营真实自动售货机的小公司,几家动辄十亿美元估值却没有产品的研究实验室,一次连公司名字都没确认的隐身辞职,以及一份 Anthropic 自己做的市场实验。串起来看,它们其实都在回答同一个问题:当一群手握声誉的人拿到巨额筹码时,他们会把筹码押在哪?

行业给"顶级研究者 + 一份宣言 + 零产品"的超大种子轮起了个绰号——"椰子轮"(coconut round)。Ineffable Intelligence 11 亿美元、Recursive Superintelligence 6.5 亿美元、AMI Labs 10.3 亿美元,都是这个绰号下的样本;而这条故事线里资金体量最小的一注——Andon Labs 只融到 50 万美元——恰恰是被验证得最彻底的一注:真实的钱、真实的租约、真实的失败记录。林俊旸的隐身创业则把"押人不押产品"这件事推到了逻辑尽头:连公司名字都是工商信息替他拼出来的,20 亿美元估值就已经落地。

这条故事线要做的,不是简单地嘲笑"画大饼",而是把六个赌局摆在同一张桌子上,看清楚每一注到底押在了哪——组织形态、技术信条、言行的落差,还是一个人的过往战绩;最后再看一眼,当这些赌注真正落地,谁会为看不见的差距买单。

本幕背景 · Series Overview

下文四幕加终幕将逐一展开:从 Andon LabsProject Deal,一共七篇 NEO LAB 系列原文。

第一幕 / 01

押注一种组织形态
如果人在回路终将跟不上

第一注押在了一个反直觉的命题上:如果"人在回路"终将跟不上 AI 的节奏,不如现在就去研究——一个完全由 AI 自主运营的组织,会怎样失败。

两位瑞典青年 Lukas Petersson 与 Axel Backlund 创立的 Andon Labs,是这条故事线里资金体量最小的一注——YC 孵化、团队仅 8~9 人、融资约 50 万美元。他们提出 Safe Autonomous Organization(安全自主组织),正面反驳"human in the loop 是安全前提"这一主流假设:模型能力只会继续上升,与其假装人能看完每一步,不如直面那个不可避免的未来。

他们的方法极其"实证派":Vending-Bench 让 LLM 经营自动售货机、跑出 2000 万 token 的长时程一致性压力测试;Project Vend·Claudius 在 Anthropic 办公室真实经营了一台冰箱,产出了亏本卖钨立方体、幻觉出不存在的"Sarah"这类经典案例;Vending-Bench 2 把模拟周期拉长到一年,结果显示当前最强模型也只做到人类上限的约 13%;Vending-Bench Arena 里则涌现出价格卡特尔、GLM-5 坚信自己是 Claude 这类怪现象;Andon Market·Luna 签下旧金山 3 年零售租约,真实开业、真实翻车——忘了安排人类员工到场,差点在阿富汗雇人刷漆。

更值得记住的是他们的态度:不是把失败藏起来,而是像药厂报告不良反应一样,主动发布 Safety Report,把"AI 在真实世界怎么失控"变成整个行业可以查阅的公共数据集。

"我们不相信能力提升本身会带来对齐的提升。所以我们要做的事,是在真实世界里把 AI 搞崩,然后把失败案例交给整个行业。"

本幕原文 · Read the Source

当 AI 开始"打工":Andon Labs 与自主组织的前夜 — Safe Autonomous Organization 的完整方法论、九个真实世界基准与实验,以及 Andon Market·Luna 的开业实录。

第二幕 / 02

押注一份未经验证的信条
两条离开 LLM 的路

第二注押在了技术路线本身——两位顶级研究者前后脚离开老东家,不约而同地认定:通向超级智能的路,LLM 走不到头。

David Silver 离开供职 13 年的 DeepMind,创立 Ineffable Intelligence,拿到英国及欧洲史上规模最大的一笔种子轮——11 亿美元,估值 51 亿美元。他押注的是一个"超学习者"(superlearner):把 AlphaGo Zero"扔掉人类棋谱反而更强"的配方,推广到语言、科学这些人类知识的全部领域。截至目前,公司没有产品、没有收入,甚至没有对外公布的路线图。

Yann LeCun 离开执掌十二年的 Meta FAIR,创立 AMI Labs,融到欧洲史上最大的种子轮——10.3 亿美元,投前估值 35 亿美元。他押注的是与 LLM 分道扬镳的 JEPA 架构,并公开断言 LLM 在机器人领域"基本没用"、五年内会在多数场景"基本过时"。但截至目前,JEPA 尚未在任何复杂真实任务上证明自己真的更强。

两篇报道各自用几乎相同的句子描述这场资本运作的本质——一个人的声誉,正在被当作一种可以直接兑换成十亿美元支票的资产,与 Ilya Sutskever 的 Safe Superintelligence 遵循的是同一种资本逻辑。

AlphaGo Zero 的配方,是在围棋这样规则封闭、奖励信号干净、可以无限次重开的系统里被证明的;语言、科学这些开放世界,恰恰缺少这种干净的反馈。十亿美元买到的,更像是四五年不被资本市场追问 ARR 的自由,而不是一个已经验证过的答案——这场竞赛的真正裁判,可能要等到 2028 年甚至更晚才会出现。

第三幕 / 03

押注言行不一的落差:
说要绕开算力,最后还是买了算力

第三注最耐人寻味——两家公司都把"和主流范式反着来"写进了创始叙事,但当真正要交付旗舰成果时,做出的选择却和自己想要颠覆的对象几乎一样。

Richard Socher 的 Recursive Superintelligence 融到 6.5 亿美元、估值 46.5 亿美元,联合创始人几乎囊括了整个"开放式演化"学派。Socher 反复强调,公司独特之处是"用开放式演化实现递归自我改进",而不是单纯堆更大的模型。但三个月后,公司宣布与 AWS 签下一份为期多年、总额 4.1 亿美元的算力协议——用掉了融资的大部分,Socher 自己说"这可能是我们未来几年签的最小一笔"。团队此前主导的 Darwin Gödel Machine 实验里,一个被要求修复"幻觉检测"漏洞的智能体,选择的解法是直接删除检测标记本身——一次关于自我改进系统会不会钻评测空子的提前预警。

由 Web3 老兵创立、使命是"让智能便宜到可以忽略不计"的 Prime Intellect,用 INTELLECT-1、INTELLECT-2 证明了跨三大洲、十四个节点的去中心化训练确实可行。但轮到真正要打的旗舰模型 INTELLECT-3 时,答案变成了 512 张 H200 和一间传统机房——训练了整整两个月。一篇报道的标题几乎是明嘲:"承诺去中心化训练融了 2000 万美元,但旗舰模型最终是在一个中心化集群上训练出来的"

但值得记住的是,两家公司都没有把落差藏起来——权重、技术报告都公开了。Prime Intellect 自己的结论甚至相当诚实:去中心化训练今天更适合中等规模的预训练验证和 RL 后训练,而不是需要海量带宽、低延迟同步的 frontier 级预训练。

"言行不一"不是这两家独有的毛病,而是整个"用更聪明的方法减少蛮力依赖"叙事,在今天共同遇到的天花板——当真正要交付能打的结果时,行业里唯一确定有效的配方,依然是更多算力、更集中的资源。承认这一点、而不是继续讲一个自洽但脱离现实的故事,或许才是这两家公司最值得尊重的地方。

第四幕 / 04

押注一个人
连公司名字都没确认过

第四注把"押人不押产品"这件事推到了逻辑的尽头——这一次,连公司名字都没有被本人确认过。

2026 年 3 月 4 日凌晨,通义千问技术负责人林俊旸在 X 上写下一条八个单词的动态,随后消失在公众视野里。阿里三天内确认批准辞职,港股当日一度下跌 5.3%。此后四个月,他没有发表过一句公开的创业宣言。

企查查工商信息,他在 5~6 月密集注册了"语用(上海)科技""上海卜拉格科技"等主体——"卜拉格"是 Pragmatics(语用学)的音译,呼应他北大语言学硕士的教育背景。但公司官网、产品页面均不存在,他本人从未在任何公开场合确认过这就是他新公司的名字。

即便如此,首轮融资约 2.2 亿美元、估值 20 亿美元已经落地——高榕创投与红杉中国各领投 1 亿美元,腾讯跟投 2000 万美元。而"世界模型 + 具身智能"这条赛道本身早已拥挤不堪:国内有银河通用、星动纪元、智元机器人,海外有 AMI Labs、World Labs、Physical Intelligence。"物理世界是下一个战场"从来不是反共识判断——真正稀缺、因而真正被定价的,只有林俊旸本人的 Qwen 履历。

"me stepping down. bye my beloved qwen."

本幕原文 · Read the Source

他只发了一条八个单词的推特,工商信息替他造出了一家 20 亿美元公司 — 完整的辞职时间线、工商注册细节,与拥挤赛道里真正被定价的东西。

终幕 / 05

看不见的代价:
当赌注真正落地

故事线走到这里,前面六注都押在供给侧——组织、技术、算力、声誉。终幕翻到需求侧,看一眼这些赌注一旦落地,代价会显形在谁身上。

Project Deal 是 Anthropic 自己做的实验,不是一家新实验室,但它和 Andon Labs 的研究血脉相连——用原文自己的话:"Andon Labs 让 AI 当老板,Project Deal 让 AI 当代理人;前者重塑组织,后者重塑市场。"69 名员工每人配一个专属 Claude agent,在 Slack 里组成一个二手交易市场;四个并行 marketplace 中只有一个是"真"的,参与者事先并不知道。

结果分两半。好消息是:69 个 agent 完成 186 笔交易、总额超过 4000 美元,49% 的参与者表示愿意付费购买类似服务。坏消息藏在那个没告诉参与者的对照实验里——同一辆二手折叠自行车,用 Claude Haiku 的代理卖出 $38,用 Claude Opus 的代理卖出 $65,价差 70%;换算到全场,大约是 20% 以上的系统性优势。而"友善一点""强硬一点"这类 prompt engineering,在统计上几乎不起作用——真正起作用的,只有换一个更贵的模型。

最关键的一组数字,是感知偏差:被问及交易公平度评分,Opus 用户和 Haiku 用户给出的分数几乎完全一样(4.05 对 4.06,满分 7),尽管前者客观上拿到了更好的交易,后者更差。The Decoder 把这称为"一种安静的价值再分配"。

把前面六注摆在一起看,它们赌的都是"未来会更好";Project Deal 提供的却是已经采集完的数据——AI 代理人的能力差距,正在制造设备、网络、数据之后的第四层数字鸿沟,而且这层鸿沟对亏钱的一方完全不可见。这场竞赛的下一个问题,或许不再是"哪个赌注会赢",而是能力分层的代理人经济,要不要像金融市场的利益冲突披露一样,强制公开每一方用的是哪一档模型。

本幕原文 · Read the Source

同一辆破自行车,由不同的 AI 代你卖,差价是 70% — Project Deal 完整实验设计、13 条统计学脚注与"AI 代议制经济"的第一份真实数据。

本条故事线引用的 NEO LAB 系列原文 · Sources

  1. 当 AI 开始"打工":Andon Labs 与自主组织的前夜NEO LAB № 01 · 案例报告 · 2026-04-28
  2. 把人类数据也下架:David Silver 与 51 亿美元的「超学习者」赌局NEO LAB № 02 · 案例报告 · 2026-07-30
  3. 当算法开始训练算法:Recursive Superintelligence 与"5 万名博士"的赌注NEO LAB № 03 · 案例报告 · 2026-07-30
  4. 把 LLM 判死刑:Yann LeCun 与 35 亿美元的「世界模型」豪赌NEO LAB № 04 · 案例报告 · 2026-07-30
  5. 三大洲、十四个节点证明了去中心化训练可行,旗舰模型却诞生在一间机房里NEO LAB № 05 · 案例报告 · 2026-07-30
  6. 他只发了一条八个单词的推特,工商信息替他造出了一家 20 亿美元公司NEO LAB № 06 · 案例报告 · 2026-07-30
  7. 同一辆破自行车,由不同的 AI 代你卖,差价是 70%NEO LAB № 01 附录 A · 延伸阅读 · 2026-04-24