BAIR + RDI · Web Agent Benchmarks
Berkeley BAIR + RDI
Dawn Song、Pieter Abbeel、Sergey Levine 等坐镇的 BAIR,联手 Dawn Song 主导的 RDI(去中心化智能研究中心),建立了评估 AI Agent「能否像人一样操作真实网站」的黄金标准 WebArena 系列基准——真实网站、长链任务、程序化验证,人类完成率约 78%,2023 年 GPT-4 仅 14%,2025 年前沿系统已追到 60%+。同时探索 TinyAgent:把工具调用能力蒸馏进 7B 小模型,让 Agent 脱离云端也能跑。RDI 每年举办 LLM Agents MOOC、Hackathon 和 Agentic AI Summit,是全球 Agent 研究社区的重要枢纽。
WebArena / ICLR 2024TinyAgentAgentic AI Summit
Sky Computing Lab · Inference Infra
Berkeley Sky Computing
创造了 vLLM——全球使用最广泛的开源 LLM 推理引擎。核心创新 PagedAttention 把操作系统虚拟内存的分页思想搬进 KV 缓存管理,GPU 显存利用率从 30-60% 提到 90%+,服务吞吐量提升 2-4 倍,如今是 Anyscale、Perplexity、阿里云等公司的推理底座。实验室由 Ion Stoica(Spark/Ray/Databricks 缔造者)领衔的谱系延伸出更大命题「Sky Computing」——跨云、跨数据中心的统一算力调度,配套项目 SkyPilot 已支持 AWS/GCP/Azure 多云 AI 任务调度。
vLLM · 50k+ ★PagedAttentionSkyPilot
OpenHands · Software Engineering Agent
CMU OpenHands
Graham Neubig 教授 2024 年发起(原名 OpenDevin),把 AI Agent 放进 Docker 沙箱,让它像人类工程师一样执行 Bash 命令、浏览网页、跑测试、提 PR。31,000+ GitHub Star,180+ 社区贡献者,在权威基准 SWE-bench(2,294 个来自 Django/Flask/NumPy 等真实项目的 bug 修复任务)上长期保持全球第一梯队成绩。Neubig 已联合创立 All Hands AI 公司将其产品化,是「学术实验室 12 个月内孵化 Agent 公司」的典型样本。
31k+ ★SWE-bench #1→ All Hands AI
Simon Initiative + LearnLab · AI Tutoring
CMU Simon Initiative
源自 1956 年 Herbert Simon 认知信息处理理论,是全球智能辅导系统(ITS)的发源地。30 年学习行为数据 + 知识追踪模型,让 AI 教师能诊断「学生为什么错」而非只判「对错」。2025 年与斯坦福合作的随机对照实验发现:人机协作辅导显著优于纯 AI 辅导——AI 擅长精准练习反馈,人类擅长情感联结与高阶引导。新框架 CogGen 正尝试用 LLM 自动生成认知模型,把 ITS 开发周期从数月压缩到数周。
ITS 发源地30 年数据积累CogGen 2025
Media Lab · Large Population Models
MIT AgentTorch
Ramesh Raskar 教授团队(核心研究员 Ayush Chopra)用「LLM Archetype」把百万级智能体的社会模拟带到 GPU 并行规模——不为每个 Agent 单独调用 LLM,而是按社会经济特征聚类成若干「原型」,一次调用后批量广播决策分布。已用于新西兰 500 万人口数字孪生(H5N1 禽流感、麻疹疫情应对)和明尼苏达州 COVID 疫苗研究,是少数把 LLM 认知能力和大规模社会仿真真正结合的系统。
LLM Archetype500 万人口孪生AAMAS 2025
CSAIL · Agent Governance & Alignment
MIT CSAIL Agent
100+ 教授、900+ 研究生的巨型研究集群,在 Agent 时代选了两条最容易被忽视但最基础的路:AI Agent Index(2025)发现 87% 的 Agent 缺乏安全说明文档;EnCompass 让 Agent 搜索逻辑代码量减少 80%;Palimpzest 自动化模型-推理配置选择。Algorithmic Alignment Group 的 Open-Universe Assistance Games 研究把对齐问题从「封闭行动空间」推广到 Agent 真正拥有的无限行动空间。
AI Agent IndexEnCompassAlignment Group
Computational Cognitive Science Lab
MIT CoCoSci
Josh Tenenbaum(2019 MacArthur Fellow)是对 LLM 最有实验数据支撑的异见者——2015 年 Science 封面论文用概率程序归纳证明:儿童仅需 1 个样本就能学会新概念,深度学习需要数千个。2023 年「From Word Models to World Models」论证语言只是理解世界的入口,物理、因果、心理直觉不能靠语言统计涌现。CoCoSci 不反 AI,2025-26 年最新工作正把 LLM 生成候选程序、贝叶斯方法筛选假设结合起来,是「若 Scaling 撞墙」的备选范式储备。
Science 封面 2015From Word to WorldCBMM
Shaping the Future of Work Initiative
MIT 劳动力未来
Daron Acemoglu(2024 诺贝尔经济学奖)、David Autor、Simon Johnson 三位顶级经济学家联手的 Stone Center on Inequality,结论与硅谷乐观叙事正面冲突:AI 高暴露职业中 22-25 岁年轻工作者就业率相对下降 16%;约 80% 美国工人至少 10% 工作任务受 LLM 影响;当前自动化导向的 AI 路径会提高资本回报、压低劳动收入,且"新任务创造"速度尚未被证明能跟上自动化速度。核心工具「工作任务模型」把职业拆解成任务级别分析技术/经济可行性。
2024 诺贝尔经济学奖Task Framework入门工作消失
Laboratory for Financial Engineering
MIT 金融工程实验室
Andrew Lo(提出「适应性市场假说」替代有效市场假说)押注:5 年内 AI 将能自主管理个人投资组合——不只是聊天建议,而是理解用户风险偏好、动态调仓、识别恐慌抛售并干预的完整财富管理民主化。团队同时研究用 LLM 解析财报和电话会议提取情绪因子(量本一体投资)、以及 AI 在金融监管中的系统性风险监测。Lo 本人身兼 AlphaSimplex 对冲基金首席策略师,是少见的「学者-真实资金基金经理」双重身份。
Adaptive Markets HypothesisQuantamental Investing神经金融学
Center for Research on Foundation Models
Stanford CRFM
Percy Liang 2021 年带队发表 200 页报告,命名了「Foundation Models」这个范式——GPT-4、Claude、Gemini 之所以能被放进同一叙事框架讨论,CRFM 功不可没。核心产出 HELM 整体性评估框架(2026.06 进入维护模式)与 FMTI 透明度指数已被欧盟 AI Act 实施团队引用为监管语言原型。2024 年启动 Marin 项目——完全开放训练自己的基础模型,权重/数据/代码/日志全公开,回答「只评估别人是否有公信力」的问题。
命名 Foundation ModelsHELM / FMTIMarin 开放模型
Digital Economy Lab + SALT Lab
Stanford 双实验室 · 未来工作
Erik Brynjolfsson 的 Digital Economy Lab 用真实企业数据测量 AI 影响:客服团队引入 AI 后生产率提升 14%,新手受益是专家的 2 倍以上;Diyi Yang 的 SALT Lab 则做 1,500 名工人 + 52 位 AI 专家的四象限调研,划出「AI 能做 × 工人愿意」的绿灯/红灯区,并提出 Human Agency Scale(H1-H5)标注每项任务人类介入的必要程度。两个实验室互补构成对「AI 改变工作」最系统的学术回答。
生产率 +14%四象限框架Human Agency Scale
Open Virtual Assistant Lab · STORM
Stanford OVAL
Monica Lam 教授团队打造的深度研究 Agent STORM:给一个话题,自动模拟不同专家视角互相提问、检索、合成,最终输出带引用的 Wikipedia 级报告,全程无需人工干预,上线以来约 100 万用户使用。升级版 Co-STORM(EMNLP 2024)引入人机协同打断/确认机制。相比 OpenAI/Google 的同类深度研究产品,STORM 完全开源、可复现、模块化——正在向生物医学文献的隐性联系发现延伸。
13k+ ★Co-STORM100 万用户
Regulation, Evaluation & Governance Lab
Stanford RegLab
Daniel Ho 领导,同时回答「AI 如何帮政府做事」和「社会如何管控 AI」两个问题——罕见的双向研究。STARA 工具帮旧金山检察官清理数千页过时法规;与普林斯顿、圣克拉拉县合作,用 AI 从 500 万份房产契约中数周内标注出种族性限制条款(人工需数十年);与圣地亚哥市合作用计算机视觉优化道路维护资源分配,避免系统性忽视低收入社区。2025 年起联合 Stanford HAI 为各级政府官员开办 AI 训练营。
STARA种族性契约识别AI Boot Camp
Scaling Intelligence Lab
Stanford Scaling Intelligence
Azalia Mirhoseini 在 Google Brain 时期用强化学习训练 AlphaChip,6 小时生成的芯片布局全面优于人类工程师,已用于谷歌 TPU 生产设计(2024 年 Nature 发过更正说明实验条件,争议本身证明这一领域已进入严肃视野)。2023 年创立的实验室追问更大命题:递归自我改进——AI 设计更好芯片,芯片训练更强 AI,能否闭环加速?她也是混合专家(MoE)架构的早期贡献者之一,2024 年联合创立 Ricursive Intelligence 继续这条路线。
AlphaChip / TPUMoE 早期贡献Ricursive Intelligence