← DeepDiveDD · 0101 · 2026-07-30
University AI Labs · Field Report
快查名录 · 19 家 →
SPECIAL ISSUE
UNIVERSITY FIELD REPORT · SPECIAL ISSUE

美国顶尖大学
AI 实验室全景

14 个实验室,6 所大学,覆盖 Agent 推理、AI 基础设施、医疗、金融、教育、劳动经济等领域。 这些研究者不争 Leaderboard——他们在定义 AI 真正做了什么,做不到什么。

Labs Covered
14
实验室
Universities
6
MIT · Stanford · Berkeley · CMU · Princeton · Harvard
Research Areas
6
垂直方向
Years Span
2021
→ 2025
Labs by Research Category COUNT
Agent & Reasoning 6
AI & Society 4
AI Infrastructure 2
Domain AI 2
§ 01 / Overview

不争 Leaderboard 的
真正研究者

2023—2025 年是美国顶尖大学 AI 研究的质变期。OpenAI 和 Google 在竞争参数规模的同时,大学实验室做了企业不会做的事:测量 AI 真正能做什么、做不到什么——以及它正在对人类社会做什么。

这 14 个实验室分布在六所大学,沿着六个方向展开:Agent 能否独立完成真实任务?LLM 对劳动市场的冲击有多深?推理效率如何成为新的能力竞赛?AI 能不能真正做出医疗诊断?芯片设计能否被 AI 接管?教育 AI 何时超过真正的教师?

这些问题的答案,没有一个能从参数量或 MMLU 分数上读出来。它们需要用 RCT 实验设计、神经科学方法、历史档案分析、甚至对 500 万份房产契约的逐条扫描来回答。这是大学 AI 研究与产业 AI 研究在方法论上的根本差异。

87% 的 AI Agent 没有任何安全文档。这不是产品缺陷,是系统性的遗漏。

§ 02 / Agents

AI Agent
能做什么,做不到什么

A01 2024 · AAMAS 2025
MIT Media Lab
Simulation LLM Agents

MIT AgentTorch:用百万 AI 智能体模拟整个社会

Ayush Chopra 和 Ramesh Raskar 带领的团队,开发了 GPU 并行的百万智能体仿真框架 AgentTorch。核心创新是 LLM Archetypes——用语言模型代替传统 ABM 的行为规则集,让每个数字人根据人口普查画像做个性化决策,而不是遵循同质化的数学方程。

2024 年,团队建立了新西兰 500 万市民的数字孪生,复现了 COVID-19 疫情下各种干预措施的效果。这是目前世界上最大规模的 LLM 驱动社会仿真,已在 AAMAS 2025 获 Oral 论文。

关键发现

LLM 驱动的百万级仿真在传染病建模上优于传统 ABM,且可以回答"如果换一种政策会怎样"的反事实问题——传统模型做不到这点。

A02 2024 · NAACL / EMNLP
Stanford OVAL
Research AI Multi-Agent

Stanford OVAL STORM:让 AI 自主写出完整研究报告

Monica Lam 的开放虚拟助手实验室(OVAL)开发了 STORM 系统:AI 通过多视角模拟对话生成维基百科级别的深度研究报告。核心创新是"预写作阶段"——让 AI 先模拟多个不同观点的专家互相提问,再基于这些问题架构研究大纲,最终生成有深度的长文。

STORM 发布后迅速成为主流:GitHub 13,000+ Stars,百万用户,衍生出 Co-STORM(人类参与的协同版本,EMNLP 2024)。这是学术 NLP 实验室罕见的大规模实际部署案例。

关键发现

比起让 AI 直接写报告,让 AI 先"模拟提问"再写作,可以显著提升内容的覆盖广度和逻辑深度——这验证了 AI 的"思考前戏"比直接生成更有效。

A03 2024 · ICLR 2024
Berkeley BAIR + RDI
Benchmark Web Agent

Berkeley WebArena:让 AI Agent 真正学会用浏览器

BAIR(Pieter Abbeel、Dawn Song、Sergey Levine 等)和 RDI 联合开发了 WebArena——真实部署的开源网站环境(购物、讨论区、代码仓库、地图),让 AI Agent 在真实网页上完成任务,而非合成环境。ICLR 2024 发表后成为 Web Agent 研究的基准标准。

关键数据对比:人类在 WebArena 上的完成率约 78%。2024 年最好的 AI Agent 约 35-40%,差距仍然巨大。这个数字在行业里广泛流传,成为"AI Agent 言过其实"讨论的核心证据。

Task Success Rate — WebArena COMPLETION %
Human 78%
Best Agent '25 ~45%
Best Agent '24 ~36%
A04 2024 · SWE-bench #1
CMU NLP Group
Code Agent 31k Stars

CMU OpenHands:让 AI 成为真正的软件工程师

Graham Neubig 的 NLP Group 开发的 OpenHands(原 OpenDevin),是目前最接近"真正独立写代码"的 AI Agent 平台。核心设计是沙盒化 Docker 运行时——Agent 可以在独立环境中自主编写、运行、调试代码,处理来自 GitHub 的真实 Issue。

OpenHands 在 SWE-bench Full(真实 GitHub Issue 修复基准)上长期位居全球第一,衍生出 All Hands AI 创业公司,GitHub 31,000+ Stars。SWE-bench Multimodal 于 ICLR 2025 发表,将评估扩展到多模态软件任务。

关键发现

SWE-bench 证明了"在真实代码库上完成真实任务"和"通过编程面试"之间存在巨大鸿沟。当前最好的 Code Agent 能解决 ~50% 的真实 GitHub Issue,但失败模式高度集中在理解跨文件上下文和长程依赖上。

A05 2025 · Safety Research
MIT CSAIL
Alignment Audit

MIT CSAIL Algorithmic Alignment:绘制 AI Agent 的全球版图与对齐边界

MIT CSAIL 算法对齐组发布了 AI Agent Index(2025),系统调查了 200+ 个已部署的 AI Agent,揭示了行业整体在安全文档、权限透明度、用户控制方面的系统性缺失。同期还发布了 EnCompass(比基线少 80% 代码量的框架)和数据科学工作流加速工具 Palimpzest。

核心数据(AI Agent Index)

87% 的已部署 AI Agent 没有任何安全文档;76% 没有明确的权限范围说明;只有 8% 提供了用户控制 Agent 行为的接口。

A06 2023–2025 · Full Stack
Princeton PLI
LLM Foundations Alignment

Princeton Language & Intelligence:在基础层埋下 Agent 的种子

Danqi Chen(RLHF 与上下文学习先驱)、Karthik Narasimhan(语言基础 Agent 先驱)和 Sanjeev Arora(理论 ML)联合领导的 PLI,是美国 LLM 基础研究密度最高的单体机构之一。研究覆盖完整 LLM 生命周期:构建(预训练/后训练)、对齐、解释。

AI²(Algorithmic Interpretability Initiative)和 NAM(Narratives and Media)是两个大型跨学科项目。PLI 研究员连续在 NeurIPS、ICLR 获得 NSF CAREER 奖项,是大学 LLM 研究的核心节点。

22—25 岁进入劳动力市场的年轻人,在 AI 高暴露职业中经历了 16% 的相对就业下降。这不是预测,是 2023 年的真实数据。

§ 03 / Society

AI 对社会的
真实冲击

B01 2023–2025 · Labor Econ
MIT Sloan + NBER
Nobel 2024 Labor

MIT 劳动力未来:三位诺贝尔级经济学家的 AI 警告

Daron Acemoglu(2024 诺贝尔经济学奖)、David Autor(劳动经济学权威)和 Simon Johnson 主导的"塑造工作的未来"计划,是美国对 AI 劳动力影响最系统的学术调查。核心命题:AI 技术的落地路径本身是政治经济选择,不是技术决定论。

Acemoglu 的旗帜性结论:我们高估了 AI 对生产力的短期影响——大量"AI 自动化"实际上只是把低质量工作外包给机器,并没有真正提升产出质量。Stone Center 对社会不平等的研究则显示,AI 收益高度集中在少数精英阶层。

关键数据

22—25 岁年轻人在 AI 高暴露职业中,就业相对下降 16%(2023 实际数据)。同期实习生职位减少明显,初级白领岗位是受冲击最重的群体。

B02 2024–2025 · RCT
Stanford HAI + SALT
Productivity AI Ethics

Stanford 双实验室:用数据丈量 AI 对工作的真实影响

Erik Brynjolfsson(Digital Economy Lab)和 Diyi Yang(SALT Lab)从两个维度测量 AI 对人类工作的影响。Brynjolfsson 的"Generative AI at Work"(与 MIT 合作)是最严格的 AI 生产力 RCT 之一;Yang 的 SALT Lab 则专注于 AI 与社会价值观的摩擦,特别是跨文化、跨语言的伦理边界。

AI 生产力提升——按工作者类型分层 PRODUCTIVITY GAIN
全体平均 +14%
新员工 +35%
高级员工 +4%

来源:Brynjolfsson et al., "Generative AI at Work" (NBER Working Paper, 2023)

B03 1993–2025 · Education
CMU Simon Initiative
AI Tutor Learning Science

CMU Simon Initiative:30 年学习科学与 AI 教师的终极融合

Ken Koedinger 主导的 Simon Initiative 和 LearnLab,是 Herbert Simon(诺贝尔经济学奖、图灵奖)认知科学传统的直接继承者。他们开发的知识组件(Knowledge Components)、知识追踪(Knowledge Tracing)和 CogGen 框架,是 AI 教师领域迄今最完整的理论体系。

CMU 的 RCT 研究(2025)结论反直觉:人类+AI 配对辅导 > 单独 AI 辅导,即便在成本受控条件下也如此。AI 在个性化难度调整上优于人类,但在识别学生情绪状态和适时切换策略上仍需人类辅助。

关键发现(arXiv:2506.20600)

CogGen 框架揭示:AI 辅导的有效性高度依赖知识组件的精准建模。一个错误的 KC 定义可以让 AI 辅导效果下降 40% 以上——"数据足够多"不能替代"认知模型正确"。

B04 2020–2025 · Gov AI
Stanford Law + HAI
Governance Policy

Stanford RegLab:让 AI 为政府工作,而非对抗政府

Daniel Ho 主导的 RegLab(Regulation, Evaluation, and Governance Lab)同时回答两个问题:政府如何用 AI 更好地执行职能?社会如何设计机制管控 AI 风险?STARA(法定研究助手)帮助旧金山市检察官清理数千页过时法规;与普林斯顿合作的 AI,从 500 万份房产契约中识别出种族性限制条款。

标志性项目

500 万份房产契约扫描:人工需要数十年,AI 数周内完成,识别出 20 世纪美国系统性种族歧视的历史证据。RegLab 使用随机对照试验(RCT)而非观察性研究,让结论在法律政策界更有可信度。

§ 04 / Infra

AI 能力竞赛的
上游战场

C01 2023 · SOSP 2023
Berkeley Sky Lab
Inference 50k★

Berkeley Sky Computing:vLLM 与下一代 AI 推理基础设施

Ion Stoica、Joseph Gonzalez 和 Woosuk Kwon 开发的 vLLM,是目前全球使用最广泛的开源 LLM 推理引擎。核心创新 PagedAttention:借鉴操作系统虚拟内存分页机制,将 KV 缓存切分成非连续内存页,GPU 利用率从 30-60% 提升至 90%+,同等硬件下 LLM 服务吞吐量提升 2-4 倍

vLLM 已成为 AI 基础设施事实标准:50,000+ GitHub Stars,800+ 贡献者,Anyscale、Perplexity AI、百度、阿里云等生产部署;2024 年 7 月成为 Linux Foundation/PyTorch Foundation 正式项目。SkyPilot 提供多云 AI 任务调度,实现跨 AWS/GCP/Azure 的自动切换和成本优化。

vLLM vs 传统推理——GPU 内存利用率 UTILIZATION
vLLM (PagedAttn) 90%+
传统推理引擎 30-60%

来源:Kwon et al., "Efficient Memory Management for Large Language Model Serving" (SOSP 2023)

C02 2021 · Nature / MoE
Stanford + Ricursive
Chip Design RL / MoE

Stanford Scaling Intelligence:用 AI 设计芯片,用芯片训更强 AI

Azalia Mirhoseini 在 Google DeepMind 用 RL 训练 AI 设计芯片(AlphaChip),于 2021 年在 Nature 发表划时代成果:6 小时内生成芯片布局,三项关键指标全面优于或持平于人类工程师,直接用于 Google TPU 和数据中心 CPU 设计。2023 年加入斯坦福创立 Scaling Intelligence Lab,目标是递归式自我改进(Recursive Self-Improvement)。

Mirhoseini 的另一重要贡献是混合专家模型(MoE)的早期发展——今天几乎所有前沿大模型(GPT-4、Gemini、DeepSeek、Llama 3)均使用 MoE 架构,这是她在 Google Brain 时期奠定的基础。2024 年联合创立 Ricursive Intelligence,专注"用 AI 设计训练 AI 的芯片"核心闭环。

递归闭环

AI 设计更好的芯片 → 芯片训练更强的 AI → 更强的 AI 设计更好的算法 → 算法产生更强的 AI。Scaling Intelligence Lab 的使命是研究这个闭环的可行性和安全性

§ 05 / Domains

医疗与金融
AI 进入临界点

D01 2021–2025 · FDA Cleared
Harvard Medical School
Medical AI Generalist

Harvard Rajpurkar Lab:打造能真正看病的 AI 医生

Pranav Rajpurkar(哈佛医学院生物医学信息学系)领导的实验室专注于通科医疗 AI(Generalist Medical AI)——整合 CT 图像、病历文字、化验数据、生命体征,像医生一样多模态推理,做出全面诊断。这是对"专科模型"范式的系统性挑战。

联合创办的 a2z Radiology AI 开发了美国首个 FDA 批准的 CT 腹盆部多发现 AI 分诊系统(De Novo 授权),覆盖 20+ 种异常发现。2025 年在 Nature Medicine 发表 ClinicalBench,在 Nature 发表多 Agent 医疗系统论文——证明多个专科 AI 协同会诊显著优于单 Agent。

最新进展(arXiv:2509.03906)

用强化学习训练与人类认知兼容的推理链——让 AI 的诊断推理过程能用医学术语表达,而不是黑盒神经网络的激活值。这是 FDA 审批和临床采用的关键前置条件。

D02 2004–2025 · Quant + AI
MIT Sloan + CSAIL
Finance AI AMH

MIT 金融工程实验室:Andrew Lo 的 AI 交易系统与金融民主化

Andrew Lo(MIT Sloan + CSAIL,AlphaSimplex 首席投资策略师)是将行为经济学、神经科学与量化交易融合的先驱。2004 年提出的适应性市场假说(AMH)从生物进化视角重构有效市场理论:市场效率随环境变化,泡沫和崩溃是进化适应滞后的结果。

Lo 的预判:5 年内,AI 将能够自主管理个人投资组合,无需人类理财顾问介入——不是聊天机器人给建议,而是真正的目标理解、动态调仓、行为纠偏、个性化建模。神经金融学研究(皮肤电导、功能性 MRI)揭示了压力激素(皮质醇)与交易决策质量的直接关联,为 AI 辅助交易提供了神经科学依据。

量本一体 · Quantamental

LLM 解析 10-K 报告、盈利电话会议、新闻文章,提取对资产价格有预测力的情绪信号,与传统量化因子(价格动量、财务比率)融合。这是大学金融实验室与对冲基金真实资本的双向验证。

§ 06 / Judgments

这 14 个实验室
给出了什么答案

01

Agent 的真实能力远低于宣传

WebArena 数据显示,最好的 Web Agent 完成率约 35-45%,人类 78%。SWE-bench 上最好的 Code Agent 修复约 50% 的真实 GitHub Issue——失败集中在跨文件上下文理解。"AI 可以替代程序员"的说法至少在 2025 年仍是过度宣传。

Berkeley BAIR / CMU OpenHands
02

AI 生产力收益高度分布不均

平均 14% 的生产力提升掩盖了极度分化的真相:新员工提升 35%,资深员工仅 4%。受益最大的是技能差距最大的人——这意味着 AI 在短期内是"才能均衡器",但也意味着初级工作岗位面临最大的替代风险。

Stanford Digital Economy Lab · Brynjolfsson et al.
03

推理效率已成新主战场

模型能力竞赛接近天花板,推理效率成为新竞争维度。vLLM 把同等计算资源的 LLM 吞吐量翻倍。本地模型研究显示,2023—2025 年单位能耗智能输出提升 5.3 倍(架构贡献 3.1×,硬件贡献 1.7×)。大量 AI 查询可以完全在端侧完成。

Berkeley Sky Computing · vLLM / PagedAttention
04

医疗 AI已到临床门槛

2024—2025 年标志着医疗基础模型从"单任务分类"到"通用医疗推理"的质变。FDA De Novo 批准、Nature Medicine 2025、Nature 2025 多 Agent 医疗系统论文——技术准备度已接近大规模临床试验门槛。缺失的是监管路径和责任框架,不是技术本身。

Harvard Rajpurkar Lab · a2z Radiology AI
05

AI 对劳动力的冲击已经发生

Acemoglu 等人的数据不是预测,是 2023 年真实发生的:22—25 岁年轻人在 AI 高暴露职业中就业相对下降 16%。这不是技术进步自然替代,是政治经济选择的后果——谁获益、谁承担成本,取决于政策设计,不取决于技术本身。

MIT 劳动力未来 · Acemoglu / Autor / Johnson
06

大学在做企业不会做的研究

AI Agent 的安全文档缺失率(87%)、AI 辅导中人类的不可替代性、AI 生产力分配的不公平性——这些发现都来自大学,不来自企业。原因很简单:企业没有动力发表对自己不利的数据。这是大学 AI 研究在这个时代最不可被替代的价值。

MIT CSAIL / CMU Simon Initiative / Stanford RegLab

这 14 个实验室的共同结论是:AI 的真实能力与公众预期之间存在一个系统性偏差——偏差的方向因场景而异,但偏差的来源是一致的:缺乏在真实环境中对真实任务的严格测量。这是大学研究者的核心使命,也是这份报告的全部意义。

§ 07 / References

完整引用来源

CODA / 结语

这 14 个实验室的价值,不在于它们能比 OpenAI 更快地发布一个更大的模型—— 它们的价值在于,它们会在模型发布后的十年里,告诉我们那个模型真正做了什么。

University AI Labs Field Report · 2025