← DeepDive  ·  实验室观察 · 学术实验室
19 家机构
大学 & 非营利研究所
LAB WATCH/学术实验室名录/2026

大学里的 AI 前沿
19 张实验室名片

从 Berkeley 的推理引擎到 MIT 的诺贝尔经济学家,从 Stanford 的治理实验室到东京之外唯一入选的公司级研究部门 Google DeepMind——这是一份不做长篇深读、只做扫描式速查的学术 AI 研究机构名录。每张卡片:这家实验室是谁、做什么、为什么值得关注。
UC Berkeley CMU ETH Zurich Google Harvard MIT Princeton Stanford UW · Ai2
UC BERKELEY · 2 家
BAIR + RDI · Web Agent Benchmarks

Berkeley BAIR + RDI

Dawn Song、Pieter Abbeel、Sergey Levine 等坐镇的 BAIR,联手 Dawn Song 主导的 RDI(去中心化智能研究中心),建立了评估 AI Agent「能否像人一样操作真实网站」的黄金标准 WebArena 系列基准——真实网站、长链任务、程序化验证,人类完成率约 78%,2023 年 GPT-4 仅 14%,2025 年前沿系统已追到 60%+。同时探索 TinyAgent:把工具调用能力蒸馏进 7B 小模型,让 Agent 脱离云端也能跑。RDI 每年举办 LLM Agents MOOC、Hackathon 和 Agentic AI Summit,是全球 Agent 研究社区的重要枢纽。

WebArena / ICLR 2024TinyAgentAgentic AI Summit
Sky Computing Lab · Inference Infra

Berkeley Sky Computing

创造了 vLLM——全球使用最广泛的开源 LLM 推理引擎。核心创新 PagedAttention 把操作系统虚拟内存的分页思想搬进 KV 缓存管理,GPU 显存利用率从 30-60% 提到 90%+,服务吞吐量提升 2-4 倍,如今是 Anyscale、Perplexity、阿里云等公司的推理底座。实验室由 Ion Stoica(Spark/Ray/Databricks 缔造者)领衔的谱系延伸出更大命题「Sky Computing」——跨云、跨数据中心的统一算力调度,配套项目 SkyPilot 已支持 AWS/GCP/Azure 多云 AI 任务调度。

vLLM · 50k+ ★PagedAttentionSkyPilot
CARNEGIE MELLON UNIVERSITY · 2 家
OpenHands · Software Engineering Agent

CMU OpenHands

Graham Neubig 教授 2024 年发起(原名 OpenDevin),把 AI Agent 放进 Docker 沙箱,让它像人类工程师一样执行 Bash 命令、浏览网页、跑测试、提 PR。31,000+ GitHub Star,180+ 社区贡献者,在权威基准 SWE-bench(2,294 个来自 Django/Flask/NumPy 等真实项目的 bug 修复任务)上长期保持全球第一梯队成绩。Neubig 已联合创立 All Hands AI 公司将其产品化,是「学术实验室 12 个月内孵化 Agent 公司」的典型样本。

31k+ ★SWE-bench #1→ All Hands AI
Simon Initiative + LearnLab · AI Tutoring

CMU Simon Initiative

源自 1956 年 Herbert Simon 认知信息处理理论,是全球智能辅导系统(ITS)的发源地。30 年学习行为数据 + 知识追踪模型,让 AI 教师能诊断「学生为什么错」而非只判「对错」。2025 年与斯坦福合作的随机对照实验发现:人机协作辅导显著优于纯 AI 辅导——AI 擅长精准练习反馈,人类擅长情感联结与高阶引导。新框架 CogGen 正尝试用 LLM 自动生成认知模型,把 ITS 开发周期从数月压缩到数周。

ITS 发源地30 年数据积累CogGen 2025
ETH ZURICH · 1 家
RSL + AI Center · Embodied AI · Zurich

ETH Zurich RSL / AI Center

Marco Hutter 主持的机器人系统实验室(RSL),是全球学术腿足机器人研究引用最广、产业转化最成功的团队——旗下 ANYmal 四足机器人已在核电站、矿井、海上平台真实作业,孵化商业公司 ANYbotics 估值超 $200M。2017 年率先解决 Sim-to-Real 迁移问题,与 NVIDIA 共建的 Isaac Lab 已成为全球腿足机器人训练的事实标准。ETH AI Center(37 位核心教授)另设医疗 AI(Gunnar Rätsch,重症监护基础模型)方向,并是 EU AI Act 技术标准制定的核心顾问。

ANYmal / ANYboticsIsaac LabEU AI Act 顾问
GOOGLE · 1 家
DeepMind + Google Research · Frontier Science

Google DeepMind / Research

2026 年 I/O 期间「主舞台之外」最重的信号是 AI for Science 矩阵:DeepMind + Google Research 5 月同日在 Nature 发表 Co-Scientist 与 ERA 两篇论文,配套 Gemini for Science 三件套上线,连接 30+ 生命科学数据库。Co-Scientist 的多代理「假设锦标赛」已在斯坦福肝纤维化、MIT+哈佛 ALS 研究中给出可验证的科学假设。基础设施侧同样密集:DiLoCo 跨数据中心训练、Gemma 4 开源四尺寸、AlphaEvolve 已在 BASF、Klarna 等企业落地——这是一家把「学术产出」当成核心竞争力经营的公司实验室。

Co-Scientist / NatureAlphaEvolveDiLoCo · Gemma 4
HARVARD · 1 家
Rajpurkar Lab · Generalist Medical AI

Harvard Rajpurkar Lab

Pranav Rajpurkar(CheXNet 作者,师从 Andrew Ng)在哈佛医学院生物医学信息学系押注「通科医疗 AI」——不是专科诊断模型的拼盘,而是能整合 CT 影像、病历文字、化验数据、生命体征做多模态推理的通用医疗大脑。联合创办的 a2z Radiology AI 已拿到 FDA 批准,是美国首个覆盖 20+ 异常发现的 CT 分诊 AI 产品,代表少见的「顶尖学术实验室直接走到 FDA 批准」路径。同时在 Nature Medicine 推动 ClinicalBench 评估框架,强调用执业医师评审而非标准 NLP 基准衡量临床 AI。

a2z Radiology AI · FDAClinicalBenchMulti-Agent 会诊
MIT · 5 家
Media Lab · Large Population Models

MIT AgentTorch

Ramesh Raskar 教授团队(核心研究员 Ayush Chopra)用「LLM Archetype」把百万级智能体的社会模拟带到 GPU 并行规模——不为每个 Agent 单独调用 LLM,而是按社会经济特征聚类成若干「原型」,一次调用后批量广播决策分布。已用于新西兰 500 万人口数字孪生(H5N1 禽流感、麻疹疫情应对)和明尼苏达州 COVID 疫苗研究,是少数把 LLM 认知能力和大规模社会仿真真正结合的系统。

LLM Archetype500 万人口孪生AAMAS 2025
CSAIL · Agent Governance & Alignment

MIT CSAIL Agent

100+ 教授、900+ 研究生的巨型研究集群,在 Agent 时代选了两条最容易被忽视但最基础的路:AI Agent Index(2025)发现 87% 的 Agent 缺乏安全说明文档;EnCompass 让 Agent 搜索逻辑代码量减少 80%;Palimpzest 自动化模型-推理配置选择。Algorithmic Alignment Group 的 Open-Universe Assistance Games 研究把对齐问题从「封闭行动空间」推广到 Agent 真正拥有的无限行动空间。

AI Agent IndexEnCompassAlignment Group
Computational Cognitive Science Lab

MIT CoCoSci

Josh Tenenbaum(2019 MacArthur Fellow)是对 LLM 最有实验数据支撑的异见者——2015 年 Science 封面论文用概率程序归纳证明:儿童仅需 1 个样本就能学会新概念,深度学习需要数千个。2023 年「From Word Models to World Models」论证语言只是理解世界的入口,物理、因果、心理直觉不能靠语言统计涌现。CoCoSci 不反 AI,2025-26 年最新工作正把 LLM 生成候选程序、贝叶斯方法筛选假设结合起来,是「若 Scaling 撞墙」的备选范式储备。

Science 封面 2015From Word to WorldCBMM
Shaping the Future of Work Initiative

MIT 劳动力未来

Daron Acemoglu(2024 诺贝尔经济学奖)、David Autor、Simon Johnson 三位顶级经济学家联手的 Stone Center on Inequality,结论与硅谷乐观叙事正面冲突:AI 高暴露职业中 22-25 岁年轻工作者就业率相对下降 16%;约 80% 美国工人至少 10% 工作任务受 LLM 影响;当前自动化导向的 AI 路径会提高资本回报、压低劳动收入,且"新任务创造"速度尚未被证明能跟上自动化速度。核心工具「工作任务模型」把职业拆解成任务级别分析技术/经济可行性。

2024 诺贝尔经济学奖Task Framework入门工作消失
Laboratory for Financial Engineering

MIT 金融工程实验室

Andrew Lo(提出「适应性市场假说」替代有效市场假说)押注:5 年内 AI 将能自主管理个人投资组合——不只是聊天建议,而是理解用户风险偏好、动态调仓、识别恐慌抛售并干预的完整财富管理民主化。团队同时研究用 LLM 解析财报和电话会议提取情绪因子(量本一体投资)、以及 AI 在金融监管中的系统性风险监测。Lo 本人身兼 AlphaSimplex 对冲基金首席策略师,是少见的「学者-真实资金基金经理」双重身份。

Adaptive Markets HypothesisQuantamental Investing神经金融学
PRINCETON · 1 家
Princeton Language and Intelligence

Princeton PLI

Sanjeev Arora、Danqi Chen、Karthik Narasimhan 2023 年创立,不追逐 Agent 应用层军备竞赛,而是在语言模型的基础层——构建、对齐、理解——制造未来 Agent 天花板的优势。Danqi Chen 研究模型知识编辑与幻觉来源;Narasimhan 是最早把 NLP 与强化学习结合的研究者之一,聚焦工具使用与长程推理。2024 年新增 AI²(AI 加速发明)与 NAM(自然与人工思维)两个方向。SimCSE、知识编辑等成果被广泛引用,博士毕业生持续输送给 Anthropic、OpenAI、DeepMind。

成立 2023SimCSE人才管道
STANFORD · 5 家
Center for Research on Foundation Models

Stanford CRFM

Percy Liang 2021 年带队发表 200 页报告,命名了「Foundation Models」这个范式——GPT-4、Claude、Gemini 之所以能被放进同一叙事框架讨论,CRFM 功不可没。核心产出 HELM 整体性评估框架(2026.06 进入维护模式)与 FMTI 透明度指数已被欧盟 AI Act 实施团队引用为监管语言原型。2024 年启动 Marin 项目——完全开放训练自己的基础模型,权重/数据/代码/日志全公开,回答「只评估别人是否有公信力」的问题。

命名 Foundation ModelsHELM / FMTIMarin 开放模型
Digital Economy Lab + SALT Lab

Stanford 双实验室 · 未来工作

Erik Brynjolfsson 的 Digital Economy Lab 用真实企业数据测量 AI 影响:客服团队引入 AI 后生产率提升 14%,新手受益是专家的 2 倍以上;Diyi Yang 的 SALT Lab 则做 1,500 名工人 + 52 位 AI 专家的四象限调研,划出「AI 能做 × 工人愿意」的绿灯/红灯区,并提出 Human Agency Scale(H1-H5)标注每项任务人类介入的必要程度。两个实验室互补构成对「AI 改变工作」最系统的学术回答。

生产率 +14%四象限框架Human Agency Scale
Open Virtual Assistant Lab · STORM

Stanford OVAL

Monica Lam 教授团队打造的深度研究 Agent STORM:给一个话题,自动模拟不同专家视角互相提问、检索、合成,最终输出带引用的 Wikipedia 级报告,全程无需人工干预,上线以来约 100 万用户使用。升级版 Co-STORM(EMNLP 2024)引入人机协同打断/确认机制。相比 OpenAI/Google 的同类深度研究产品,STORM 完全开源、可复现、模块化——正在向生物医学文献的隐性联系发现延伸。

13k+ ★Co-STORM100 万用户
Regulation, Evaluation & Governance Lab

Stanford RegLab

Daniel Ho 领导,同时回答「AI 如何帮政府做事」和「社会如何管控 AI」两个问题——罕见的双向研究。STARA 工具帮旧金山检察官清理数千页过时法规;与普林斯顿、圣克拉拉县合作,用 AI 从 500 万份房产契约中数周内标注出种族性限制条款(人工需数十年);与圣地亚哥市合作用计算机视觉优化道路维护资源分配,避免系统性忽视低收入社区。2025 年起联合 Stanford HAI 为各级政府官员开办 AI 训练营。

STARA种族性契约识别AI Boot Camp
Scaling Intelligence Lab

Stanford Scaling Intelligence

Azalia Mirhoseini 在 Google Brain 时期用强化学习训练 AlphaChip,6 小时生成的芯片布局全面优于人类工程师,已用于谷歌 TPU 生产设计(2024 年 Nature 发过更正说明实验条件,争议本身证明这一领域已进入严肃视野)。2023 年创立的实验室追问更大命题:递归自我改进——AI 设计更好芯片,芯片训练更强 AI,能否闭环加速?她也是混合专家(MoE)架构的早期贡献者之一,2024 年联合创立 Ricursive Intelligence 继续这条路线。

AlphaChip / TPUMoE 早期贡献Ricursive Intelligence
UW + AI2 · 1 家
Allen School + Allen Institute for AI

UW Ai2 · OLMo

华盛顿大学 Allen School 与非营利 Ai2(Paul Allen 2014 年创立)构成美国最紧密的学术-非营利 AI 协作——教职联合任命,OLMo 项目由同时身兼教授和 Ai2 高级总监的人共同领导。OLMo 是全球最「真开源」的 LLM 系列:不仅开放权重,还开放训练数据、代码、日志,与 Llama 只开权重形成本质区别;配套的 OLMoTrace 能把模型输出溯源回具体训练文档。2025 年 8 月启动的 OMAI($152M,NSF + NVIDIA)是美国学术界最大的单笔开放 AI 基础设施投入。

OLMo 真开源OLMoTraceOMAI $152M
19 家实验室,一张 学术 AI 地图
LAB WATCH · 学术实验室 · 研究截止 2026-07 · 返回 DeepDive