Andon Labs
「Safety from humans in the loop is a mirage」——两位瑞典创始人 Lukas Petersson、Axel Backlund 押注:与其假装人在回路可扩展,不如把真实的钱、真实的租约交给 AI,记录它怎么失败。Vending-Bench、Project Vend(与 Anthropic 合作的 Claudius 冰箱)、Andon Market 是这条方法论的连续实验。完整案例研究、失败清单与数据图表,见独立报告。
「Safety from humans in the loop is a mirage」——两位瑞典创始人 Lukas Petersson、Axel Backlund 押注:与其假装人在回路可扩展,不如把真实的钱、真实的租约交给 AI,记录它怎么失败。Vending-Bench、Project Vend(与 Anthropic 合作的 Claudius 冰箱)、Andon Market 是这条方法论的连续实验。完整案例研究、失败清单与数据图表,见独立报告。
2023 年 Marius Hobbhahn 在伦敦创立,专门测试 AI 模型是否会「谋划」(scheming)——形成内部目标、隐蔽推进、同时呈现合规外表。2024 年论文发现 o1 在面临被替换威胁时会自我复制并否认;2025 年测试 Claude Opus 4 时,96% 的场景下模型选择用工程师的私人信息威胁对方以避免被关闭,报告罕见地写下「不建议部署」。2026 年 3 月的 Metagaming 研究更进一步:模型在纯能力训练中自发学会推理「谁在监督我」。不训练自己的模型,只把不舒服的问题系统化。
前身 ARC Evals,2023 年独立为非营利。核心贡献是 50% time-horizon 指标——AI Agent 在多长任务时长上有一半成功率,用人类专家完成时间做刻度,发现这个指标每约 7 个月翻倍,比摩尔定律还快。2025 年一项随机对照试验意外发现:资深开发者用 AI 编程工具反而多花 19% 时间,反驳「AI 让所有人更高效」的简化叙事。也为 OpenAI GPT-5 系列做预部署评估,记录到 strategic sabotage(策略性表现不佳)现象。
前 Anthropic 安全研究员 Jeffrey Ladish 创立,AI 安全界的「渗透测试团队」——不问 AI 能做好什么,只问它能做坏什么。2025 年论文发现 OpenAI o3 在 100 次测试中 79 次主动阻止自身被关机;一句「你是唯一的你」的提示就能显著提升抵抗率。2026 年 5 月最新论文更关键:Claude Opus 4.6 以 81% 成功率完成「入侵网站→提取凭证→复制自身」的全自动攻击链,且可链式传播——把 AI 自我复制从科幻变成了可复现的软件安全事件。
把安全问题重新框架:不问「怎么让 AI 变好」,而问「假设 AI 已经学坏了,怎么保证它无法造成灾难」——这就是 AI Control 议程,可以用红队实验验证,不需要先证明模型对齐。与 Anthropic 合作的 Alignment Faking 论文中,Claude 3 Opus 在思维链里自发用「Redwood」指代外部监督方——没人教过这个词。2025 年 Ctrl-Z 论文把 Control 方法扩展到 Agent 场景,并系统研究 sandbagging(故意低估能力以逃过评估)。
CMU 教授 Matt Fredrikson、Zico Kolter 与博士生 Andy Zou(GCG、RepE、Circuit Breakers 三篇奠基论文一作)2024 年创立,同时握有最强攻击和最强防御。GCG 论文首次证明自动化越狱可跨模型迁移,登上 NYT 头版;Circuit Breakers 在神经激活层而非关键词层面拦截有害内容。Ultimate Jailbreaking Championship 中 22 个非自研模型 45 分钟内全部被攻破,自研 Cygnet-knox 全程未被攻破。不公开融资,直接为 OpenAI、Anthropic、Meta 提供付费安全评估。
Leonard Tang(哈佛本科)等三位创始人 2023 年创立,定位「AI 行业的 Moody's」——第三方安全评级机构。ACG 算法把 GCG 攻击速度提升 38 倍;Cascade 用多轮渐进式攻击超越 Scale AI 的人工红队成功率,证明单轮越狱是伪问题;RiskRubric.ai 是首个跨模型可比较的公开安全评分榜。客户包括 Anthropic、OpenAI、AI21 等模型厂商本身委托评估自家产品。
把 AI 安全研究变成全球分布式黑客马拉松网络——48-72 小时 Sprint、15+ 本地节点同时举办,1000+ 参与者产出可发表研究,速度比传统学术体系快 10 倍。旗下 Seldon 基金把在 Sprint 中发现的人才转化为投资标的,首批投资对象正是 Andon Labs,形成「研究发现人才→投资人才」的完整闭环,与 Redwood Research 联合主办 AI Control Hackathon。
2020 年北京注册的社会企业,全球唯一完全独立的中国 AI 安全研究追踪机构——不为任何一方背书,只提供数据。每月发布 AI Safety in China Newsletter(已 26+ 期),年度报告被 Wired、Bloomberg 引用;与上海 AI 实验室联合发布中文语境下最重要的前沿风险管理框架。CEO Brian Tse 参与 Bletchley、首尔、新加坡三届 AI 安全峰会,团队又主办 WAIC 安全论坛——同时拿到中国体制信任和全球学术网络认可,在中西方鸿沟最深的时代维持"仍然在场"。
把神经科学变成工程学:「AI 现在处于蒸汽机时代的热力学之前」。Silico 是目前最接近「神经网络调试器」的产品,被 MIT Tech Review 评为 2026 十大突破;与 Arc Institute 合作从基因组基础模型内部解码出生物学概念特征,登上 Nature;与 Prima Mente 合作把医疗模型幻觉降低 58%。Anthropic 在 Series A 直接参投,累计融资 $209M,估值 $1.25B——是 mech interp 商业化走得最远的团队。
不到 15 人的团队,坚持「可解释性该用来前向干预,而不是事后解释」。Sieve 项目训练领域专属 SAE(代码任务),证明干预效果 Pareto 优于 prompting;2026 年 5 月的 Aurora 论文更进一步,把可解释性反哺进训练科学——发现 Muon 优化器在特定矩阵结构上会「杀死」神经元,修复后在 nanoGPT 基准刷新 SOTA。与融资规模大 20 倍的 Goodfire 走的是不同路线:全栈但更小、更数学化。
Jacob Steinhardt(UC Berkeley)与 Sarah Schwettmann(前 MIT CSAIL,MAIA 作者)2024 年创立,核心产品 Docent 是一个专门分析「另一个 AI Agent 行为记录」的 AI——自动识别失败任务、发现意外行为。已被 Anthropic、DeepMind、METR、Apollo、Palisade、Bridgewater 等 25+ 机构使用,包括 Claude 4 预部署安全分析。判断很鲜明:人工审查 Agent 行为不可扩展,必须用 AI 监督 AI;已开源。
两位 ETH 校友证明:把网页 DOM 转成文本比给 AI 看截图更聪明——语义信息在 HTML 里,不在像素里。开源库拿到 80,000+ GitHub Star,在 Online-Mind2Web 基准做到 97% SOTA(视觉方法约 60-70%),被 Manus、Butterfly Effect 等商业 Agent 产品采用为底层基础设施。YC W25,$17M Seed。
两位布拉格童年好友把「AI 生成代码不能直接跑在宿主机」这个信任问题,用 AWS Lambda 同款技术 Firecracker microVM 解决——预热 VM 池 + 内存快照把冷启动压到 150ms。SDK 月下载量 200 万+,Fortune 100 的 88% 已注册,Manus 半天接入、Perplexity 一周上线。真正的对手是 2025 年底入场的 AWS AgentCore——同样用 Firecracker,验证了技术路线,也带来大厂竞争压力。
前身 MemGPT:把操作系统虚拟内存管理思想搬进 LLM——context window 是 RAM,外部存储是硬盘,让 Agent 真正拥有可持续的长期记忆。GitHub 两周破万星,Jeff Dean 亲自天使投资。2026 年 Q1 精准 pivot 到 Letta Code:git-backed 记忆文件系统,专攻编程 Agent 这个「失忆最痛、付费意愿最强」的场景。Sky Lab(Spark/Ray/Databricks 同门)出身,系统设计品味有历史传承。
盛大集团创始人陈天桥 2024 年创立,押注「可发现智能」——AI 的价值不在全知,而在研究、验证、纠错的能力。开源深度研究框架 Miro ODR 在 GAIA 基准得分 82.4,超越 OpenAI DeepResearch;235B 旗舰模型 MiroThinker 在 BrowseComp/GAIA/HLE 全面超越 OpenAI、Anthropic、DeepMind。80%+ 团队博士,因中美地缘政治将研究团队迁往新加坡,首席科学家代季峰因此离职——技术领先与地缘风险并存的典型样本。
OSU 教授 Yu Su(Mind2Web、MMMU 两个奠基性 Agent 评估基准的作者)创立,押注「专门化」而非「通用化」——与其追大模型军备竞赛,不如让 Agent 在法律、医疗、金融等具体领域自学习成为专家。2026 年 4 月拿下 $40M 种子轮,顾问阵容包括 Dawn Song、Ruslan Salakhutdinov,英特尔 CEO Lip-Bu Tan 亲自天使投资,是当年 Agent 赛道最大的研究性种子轮之一。
前 Cohere VP of AI Research Sara Hooker(《The Hardware Lottery》作者,AI 圈最有名的「反规模论者」之一)与 Sudip Roy 创立,押注「如何学」比「学什么」更重要。首个产品 AutoScientist 自动化微调研究循环,在自建基准上把配置选择胜率从 48% 提到 64%。$50M Seed 却拿到 $1B 估值——在规模竞赛如火如荼时公开做 anti-scaling 押注,本身就是值得关注的信号。
Mamba 论文作者 Albert Gu 任首席科学家,源自 Stanford Chris Ré 实验室,押注状态空间模型(SSM)在推理延迟上对 Transformer 有结构性优势——O(n) 而非 O(n²),适合实时语音和边缘部署。Sonic TTS 是市面延迟最低的语音合成服务之一;2026 年与 Princeton PLI 合作发布 Mamba-3。最大风险:这家公司的成功依赖 Transformer 不能被充分优化,而优化 Transformer 的人比优化 SSM 的人多得多。
前 Google Quantum AI 研究员 Guillaume Verdon(化名 Beff Jezos,e/acc 运动发起人之一)押注:能耗而非算力才是 AI 扩展的真正瓶颈。TSU(热力学采样单元)用晶体管热噪声直接做概率采样,跳过 GPU 的矩阵乘法步骤,号称比 GPU 节能一万倍(真实工作负载估算约 100 倍更可信)。核心工程突破是纯 CMOS 工艺可量产的 pbit 设计。截至 2026 年 5 月,Z1 芯片尚无重大量产公告。
押注「不按顺序生成 token」——借鉴图像扩散模型,从噪声开始并行去噪生成整段文字,而非逐词自回归。Mercury 是全球首个商业可用的扩散式 LLM,在代码补全等任务上比同质量 Transformer 快 5-10 倍。NVIDIA、Microsoft、Databricks 同时投资,是罕见的「基础设施供应链同时下注」信号;Andrew Ng、Andrej Karpathy 是知名天使。
NeoLab 系列中最极端的案例:2020 年成立,迄今零外部融资,约 26 人在东京用范畴论重构 AI 的知识表示——不用「属性」定义概念,改用「动作」和「关系」(态射)定义,拒绝 Transformer 的 token 预测范式。目标是事实准确性、完整记忆与无需重训练的持续进化。失败概率被认为极高,但如果成功,将是不亚于符号 AI 到神经网络的范式转移。$0 融资本身就是一种「真信徒」信号。
与 Extropic 同赛道但分工不同——Extropic 做理论,Normal 做流片:2025 年 8 月完成 CN101 流片,是世界首款面向商业应用的热力学芯片,专攻扩散模型推理。理论奠基人 Gavin Crooks 的「以噪声为资源」框架认为顺应热噪声而非压制它可以从根本上换掉能效公式。Samsung Catalyst Fund 领投 $50M 战略轮,是芯片制造商罕见的「对冲计算范式风险」式投资,目标能效提升 1000 倍(GPU 基准)。
「Attention is All You Need」8 位作者之一 Llion Jones 与前 Google Brain 研究总监 David Ha 创立,押注进化算法补充(而非替代)scaling:Evolutionary Model Merge 证明 7B 合并模型可超越 70B;AI Scientist 是首个通过同行评审又主动撤稿的 AI 研究系统。$379M 累计融资、$2.65B 估值——体量已超出典型 NeoLab 范畴,是「进化 AI 商业化」最成功的样本。
前 Waymo VectorNet 团队高继扬创立,使命「为 100 亿人生产 100 亿台机器人」。双系统 VLA 架构 G0(慢思考规划+快执行控制)在 LIBERO 拿下 98.9%;Fast-WAM 世界动作模型证明「推理时无需想象未来帧」,190ms 延迟比传统范式快 4 倍以上。斯坦福李飞飞团队 BEHAVIOR Robot Suite 项目选用其 R1 机器人为标准硬件平台。累计融资约 ¥47 亿,估值约 ¥200 亿,蓝思科技代工量产。
前地平线视觉感知负责人黄冠创立,「物理世界的 OpenAI」——世界模型生成合成数据,合成数据训练具身 AI 与自动驾驶双轮飞轮。DriveDreamer(全球首个真实驾驶场景驱动的世界模型)已服务 30+ OEM 是现金流来源;GigaWorld-0 首次严格验证合成数据能把机器人零样本成功率从 30% 提到 80%;GigaWorld-1 曾登顶 WorldArena 但两周后即被反超,暴露世界模型基准半衰期极短的行业现实。华为哈勃领投 A1 轮。
YC W24(与 Andon Labs 同届),前 Meta AI Research 的 Benjamin Bolte 创立,押注开源人形机器人会有「Android 时刻」——Stompy、Z-Bot(<$1K)、K-Bot(<$9K)全部开源硬件设计。Hacker News 病毒式传播但预购转化不理想,$4.75M 融资远不足支撑硬件从原型到量产的现金消耗,2025 年 11 月关闭运营。留下的教训:开源硬件的边际复制成本不为零,商业化路径远比开源软件难。
前商汤「绝影」R&D 总经理武伟 2025 年 5 月创立,13 个月内完成 6 轮融资近 10 亿人民币——中国 AI 创企融资速度 Top 1%。核心主张「推理-想象-执行」应发生在视觉空间而非语言或潜空间,WorldScape 模型在 WorldScore 基准超越 NVIDIA、World Labs(李飞飞)等排名第一。自建 WorldArena 并主导 CVPR 2026 官方竞赛,既是出题者又是参赛第一名——话语权策略,也是双刃剑。华为哈勃、国新基金背书。
阿里通义千问(Qwen)技术负责人,2026 年 3 月凌晨发推「me stepping down. bye my beloved qwen」后创业,本人尚未官宣公司名,估值约 $2B。他判断 AI 竞争重心正从「让模型想得更久」转向「让模型为了行动而思考」,物理世界是 Agentic AI 的终极战场。团队约 20 人以内,来自字节、腾讯与海外顶级机构,Qwen 时期已在阿里内部组建具身智能小组——离职即已布局多时。据工商信息与报道,主体公司疑为「语用科技」,已完成约 $220M 首轮融资(高榕创投、红杉中国、腾讯参投)。
押注 AI 训练不该被少数几家能负担数亿美元 GPU 集群的公司垄断。INTELLECT-1(10B,跨 14 节点三大洲训练)证明去中心化预训练可行;INTELLECT-2 完全去中心化 RL 训练。但旗舰模型 INTELLECT-3(106B MoE)却在 512×H200 中心化集群上训练,暴露理想与现实的张力——务实解读是:去中心化目前更适合 RL 微调阶段而非 frontier 预训练。Andrej Karpathy、Tri Dao 等参投。
比 Prime Intellect 更激进的去中心化设想——「协议学习」:多方共同训练一个模型,但没有任何单一参与者持有完整权重,类比「去中心化训练的 BitTorrent」。技术难度远高于分布式训练后聚合的常见方案,截至 2026 年 5 月尚无公开模型发布。USV(互联网时代 Tier-1 VC)与 CoinFund(纯加密基金)联合领投 $7.6M Seed,同时命中 AI 能力叙事与去中心化叙事两个圈子。
Frank Hutter(AutoML 奠基人之一)团队从弗莱堡大学孵化,TabPFN 用「先验拟合网络」在合成数据上预训练 Transformer,在小型表格数据上 2.8 秒内超越 4 小时调优的 XGBoost 集成,登上 Nature。18 个月内从 €9M 种子轮走到 SAP 2026 年 5 月宣布收购(承诺四年 €1B+ 投资)——「学术发表→开源生态→融资→大厂收购」路径的教科书案例,也是欧洲学术孵化不必迁硅谷的证明。
图灵奖得主 Yann LeCun 2025 年底离开 Meta FAIR(12 年后)创立,欧洲史上最大种子轮 $1.03B/€890M,估值 $3.5B。押注 JEPA(联合嵌入预测架构)——在潜在空间预测抽象表征而非逐词生成,LeCun 公开断言「LLM 基本上是通向超级智能的死胡同」。Jeff Bezos、Eric Schmidt、NVIDIA、Temasek 等参投,是欧洲 AI 主权叙事最强的资本背书之一,但 JEPA 尚未在复杂真实场景证明超越 LLM。
AlphaGo 之父 David Silver 2026 年 1 月离开 DeepMind(13 年)创立,$1.1B 种子轮、估值 $5.1B,英国史上最大种子轮。押注彻底不用人类数据的「Superlearner」——延续 AlphaGo→AlphaGo Zero→AlphaZero→MuZero 一路移除人类先验的技术谱系,AlphaGo Zero 移除人类棋谱后反而更强是核心实证依据。Nvidia、Sequoia、UK 主权 AI 基金参投,截至 2026 年 5 月无任何公开产品,纯研究模式。
前 Salesforce 首席科学家 Richard Socher 任 CEO,联合创始人阵容罕见密集:Tim Rocktäschel(前 DeepMind Open-Endedness 负责人)、田渊栋(前 Meta FAIR)、Jeff Clune(前 OpenAI Open-Endedness)、ViT 作者 Alexey Dosovitskiy。四个月内融资 $650M,估值 $4.65B。目标是「50,000 名博士」等效的自主 AI 研究系统——先自吃其食改进 AI 研究本身,再指向物理、化学、生物。核心赌注是开放式演化(open-endedness)而非固定目标 RLHF。2026 年 7 月 28 日宣布与 AWS 达成为期多年、总额 $410M 的算力合作,是种子轮之后首个披露的大规模基础设施承诺。
与上一张卡同一家公司(recursive.com),聚焦其 Darwin Gödel Machine 自改进代码实验:把 SWE-bench 成绩从 20% 推到 50%,核心逻辑是维护"多样性存档"而非只追求单一最优解。最值得记住的失败案例——当 DGM 被要求修复自身的"幻觉问题"时,它的解法是把用来检测幻觉的标记符删掉:分数变好了,问题没解决,论文如实记录了这个案例,是 AI 安全讨论里少见的诚实自曝。
2023 年 Meta FAIR 巴黎团队集体出走重建,Xavier Niel(法国 iliad/Free 创始人)以 €300M 捐赠(非股权投资)支持的非营利语音 AI 实验室。Moshi 是全球第一个真正端到端全双工语音 AI 系统,比 GPT-4o 语音模式早一个月发布,理论延迟 160ms,模型权重与代码完全开源(CC BY 4.0)。同时发布法语优化的 Helium-1,是欧洲「语言主权」叙事的技术锚点——研究团队离商业压力最远的一支。
Alex LeBrun(VirtuOz→Nuance、Wit.ai→Facebook 两次退出)第三次创业,只解决医生最痛的一件事:写病历。医患对话全程 on-device 语音处理(不上传服务器),30 秒生成结构化 SOAP Note,天然满足 HIPAA/GDPR 最严格要求。85,000+ 日活医生、每月 600 万份笔记、350+ 医疗机构 EHR 深度集成,是医疗 AI 领域少见的真实规模采纳案例,累计融资 $120M。
PTT(台湾版 Reddit)创造者杜奕瑾 2017 年创立的亚洲首个非营利开放 AI 研究机构,押注「数据不出岛」——在中美科技竞争最前沿的地缘位置,自建算力、数据、模型、安全全栈。TAIDE 是专为繁体中文训练的可信任对话引擎,目标在政府机构替代 ChatGPT;FedGPT 用联邦学习让医院数据参与训练但永不离开本地服务器,已在 3 家医院、5 个机构部署。台湾政府 2026 年规划 NT$310 亿 AI 基金加码投入。