跳到正文
← DeepDive 实验室与建设者 ·
← DeepDiveUNIVLAB · C01 · 2026 · AUG 17
DEEPDIVE / [UNIV LAB] · BERKELEY SKY COMPUTING
v1 · 2026 · AUG 17
LAB PROFILE AI 推理基础设施 · 多云调度 UC Berkeley, CA

Berkeley Sky Computing
一篇论文奠定的 AI 基础设施帝国

Sky Computing Lab 创造了 vLLM——目前全球使用最广泛的开源 LLM 推理引擎,用 PagedAttention 算法让 LLM 服务吞吐量提升 2-4 倍,成为从创业公司到互联网大厂部署 AI 模型的基础设施标准。

类型 / TYPE
大学研究实验室
领域 / FOCUS
AI 推理基础设施 / LLM Serving / 多云调度
总部 / HQ
UC Berkeley, Berkeley, CA
成立 / FOUNDED
规模 / TEAM
融资 / FUNDING
校内资助 + 产业合作(Intel 等)
状态 / STATUS
活跃 · vLLM 为 Linux Foundation 正式项目
最后核实 / VERIFIED
2026-08-17
§ 01 / 是什么

AI 基础设施的
"水电煤"

AI Agent 的繁荣建立在一个经常被忽视的基础之上:高效的模型推理。一个请求从进入系统到返回结果,要经过请求路由、模型加载到 GPU、前向计算(生成 token)、KV 缓存管理(记忆上下文)、结果返回五个步骤,其中前向计算和 KV 缓存管理是性能瓶颈——LLM 在生成过程中需要为每个 token 存储 Key-Value 缓存,随着上下文长度增加,内存消耗呈线性增长,严重限制并发处理能力。这就是 vLLM 要解决的问题,由 UC Berkeley Sky Computing Lab 创造,核心人物包括 Ion Stoica、Joseph Gonzalez、Woosuk Kwon 等。

核心创新是 PagedAttention,由 Woosuk Kwon(当时的 Berkeley 博士生)等人提出,灵感来自操作系统虚拟内存的分页机制。传统 LLM 推理中,KV 缓存在 GPU 内存中连续分配,每个请求独占其分配的内存块,即使只用了 30% 也不能给其他请求使用;PagedAttention 将 KV 缓存切分成小的"内存页",不同请求的 KV 缓存可以存储在不连续的内存页中,由一个虚拟地址表管理——本质上是给 LLM 推理引入了虚拟显存。效果:GPU 内存利用率从约 30-60% 提升到 90%+,同等硬件下 LLM 服务吞吐量提升 2-4 倍,并支持更长的上下文窗口。

§ 02 / 关键事实

vLLM 生态
与 Sky Computing 愿景

vLLM 于 2023 年发布后以惊人速度成为行业标准:GitHub Star 超过 50,000(截至 2025 年),贡献者 800+(来自全球公司和高校),支持 100+ LLM 架构(Llama、Mistral、GPT-NeoX 等),2024 年 7 月成为 Linux Foundation(PyTorch Foundation)正式项目。生产部署方包括 Anyscale、Replicate、Perplexity AI、百度、阿里云等,Meta、Google 内部团队也有基于 vLLM 的部署。

vLLM 只是实验室更大愿景的一个具体产出。Sky Computing Lab 研究的核心问题是跨云、跨数据中心的统一计算资源调度——类比 IP 协议让不同网络互联互通,Sky Computing 要让应用可以跨越 AWS、Google Cloud、Azure 等不同云环境无缝运行:当一个云服务商的 GPU 全满时自动切换到另一个,根据实时价格动态选择最便宜的计算资源。SkyPilot 是实验室的另一个重要开源项目,一个能自动在多个云服务商之间调度 AI 训练和推理任务的工具,支持 AWS、GCP、Azure、Lambda Cloud 等。

2024-2025 年最新研究方向包括 vLLM Semantic Router(根据请求复杂度动态路由到不同规模模型)、Multi-Bin Batching(针对长度差异大的请求批次优化 GPU 内存填充效率),以及面向 AI Agent 的推理基础设施(跨轮 KV 缓存保存、多 Agent 共享 System Prompt 的缓存复用)。一项覆盖 20+ 本地 LLM、8 种 AI 芯片、100 万+ 真实查询的大规模实证研究还发现:本地模型能成功处理 88.7% 的单轮问答和推理查询,2023 到 2025 年间单位能耗的智能输出提升了 5.3 倍。

§ 03 / 张力与判断

开源基础设施的
路径依赖效应

模型能力的竞赛正在接近天花板,推理效率成为新的竞争维度——vLLM 把同等计算资源的产出翻倍,相当于让每家公司的 AI 基础设施成本减半。这也是为什么一所大学实验室的开源项目,能在商业公司林立的推理基础设施赛道占据主导地位:学术界没有把 PagedAttention 藏在专有产品里变现,而是开源,让它迅速成为事实标准。

这种路径依赖是把双刃剑:vLLM 如今已是 AI 基础设施的事实标准,它的架构决策和 API 设计将影响整个行业生态数年,这既是 Berkeley 的胜利,也意味着未来任何试图挑战这个标准的方案都要先克服巨大的生态惯性。同时,一个诞生于学术实验室、由博士生主导核心创新的项目能否持续跟上工业级需求(多租户隔离、企业级 SLA、安全合规),是 vLLM 从"最好的开源方案"走向"不可替代的基础设施"过程中必须回答的问题。

Sky Computing 本身的问题——多云互联调度——目前还处于早期。如果 AI 推理真的成为像互联网一样的基础服务,多云互联问题将像 30 年前的网络互联一样重要,Berkeley 正在为这个问题奠定理论和工具基础,但这个愿景能否实现,很大程度上取决于云厂商是否愿意开放足够的互操作性——这不完全是技术问题,也是商业博弈问题。

Sky Computing Lab 用 vLLM 证明了一件事:在 AI 基础设施这个层面,最重要的创新未必来自资金最雄厚的实验室,而可能来自一个理解操作系统经典原理、并愿意把它开源出来的博士生。vLLM 的成功也重新定义了大学实验室在 AI 产业链中的位置——不再只是发论文,而是直接定义了下游千万家公司赖以运行的基础设施标准。这种影响力的杠杆率,在 AI 应用层的竞争中很难被复制。

来源 / SOURCES
← 全部实验室索引 · DeepDive 首页

更新记录

首次发布 2026-08-17