跳到正文
← DeepDive 实验室与建设者 ·
← DeepDiveUNIVLAB · A03 · 2026 · AUG 17
DEEPDIVE / [UNIV LAB] · BERKELEY BAIR+RDI
v1 · 2026 · AUG 17
LAB PROFILE 浏览器 Agent 训练/WebArena UC BERKELEY, CA

Berkeley BAIR + RDI
给"会用网页"划一条真实的及格线

BAIR 建立了评估 AI Agent 能否像人一样操作真实网站的黄金标准——WebArena 系列基准;同时通过 TinyAgent 探索把大模型压缩到设备端,让 Agent 脱离云服务也能完成复杂任务。

类型 / TYPE
大学研究实验室
领域 / FOCUS
浏览器 Agent 基准 / 端侧 Agent
总部 / HQ
UC Berkeley(伯克利, CA)
成立 / FOUNDED
—(BAIR/RDI 成立年份未披露)
规模 / TEAM
BAIR:50+ 位教授,数百名研究生
融资 / FUNDING
校内资助(未公开金额)
状态 / STATUS
活跃 · WebArena 系列持续迭代
最后核实 / VERIFIED
2026-08-17
§ 01 / 是什么

两个团队,一个问题:怎么证明 Agent"真的会用网页"

BAIR(Berkeley Artificial Intelligence Research)是全球最具影响力的 AI 研究院之一,拥有 50+ 位教授、数百名研究生,横跨机器学习、计算机视觉、机器人、NLP 等方向,Pieter Abbeel、Sergey Levine、Dawn Song、Stuart Russell 均是其成员。RDI(Center for Responsible, Decentralized Intelligence)由 Dawn Song 教授主导,专注于 AI 的可信度与安全性,近年在 LLM Agent 研究上投入大量资源。两个团队在 Agent 基准测试上形成合力:BAIR 贡献技术创新,RDI 关注评估的可信度与安全性。

ChatGPT 出现后,研究者很快意识到光靠问答能力测不出 Agent 的真实水平——真实世界的 Agent 任务是"在 GitHub 上开一个 issue"、"在电商网站上比价找到最便宜的商品"这类需要多步骤规划、跨页面导航、读懂视觉布局、处理动态内容的复合任务。传统的 QA 或代码生成基准完全无法覆盖这些维度,Berkeley 团队的回答是:自己搭建一个真实的、可重复的、公平的评估环境。

WebArena(ICLR 2024)是团队构建的第一个大规模网页 Agent 基准,设计哲学是完整搭建的真实网站(电商、论坛、项目管理、内容编辑、地图)而非玩具示例,每个任务平均需要 10+ 步操作、人类完成率约 78%,且每道题都有程序化的验证逻辑,Agent 完成后自动判断对错,杜绝主观打分误差。

§ 02 / 关键事实

从 14% 到 60%+,以及一个反方向的赌注:TinyAgent

WebArena 上线以来,模型成绩持续攀升:2023 年发布时最强基线 GPT-4 只有约 14% 成功率,2024 年中最优商业模型追到约 40%,2025 年前沿 Agent 系统已超过 60%——而人类完成率约 78%,这条不断缩小的差距,正是 WebArena 推动行业进步的核心动力。2024 年发布的 VisualWebArena 在此基础上加入图片、图表、UI 截图的理解要求,覆盖基于商品图片的比较购物、阅读评论截图撰写回复、根据数据图表做决策等场景,直接检验多模态模型能否真正"看着屏幕做事"而非只读 HTML 源码。

与云端评估方向并行,团队在 2024 年 5 月的 TinyAgent 项目探索了完全相反的问题:LLM Agent 必须依赖云端大模型吗?方案是用 7B 参数量级的小模型配合精心设计的工具调用框架,把大模型的工具调用能力蒸馏进小模型,再做 4-bit 量化,使其可在 Apple Silicon 笔记本本地运行。测试结果显示,在特定工具调用任务上 TinyAgent-7B 的表现接近 GPT-4 Turbo,而推理速度更快、成本趋近于零。

RDI 同时是 LLM Agent 研究社区的重要组织者:与多所大学合作推出的 LLM Agents MOOC 累计数万人参与;配套的 Hackathon 设 Application 与 Benchmark 两条赛道;2025 年 8 月在伯克利举办的 Agentic AI Summit 汇聚学术与工业界讨论 Agent 系统架构、安全边界与多 Agent 协作等议题。

§ 03 / 张力与判断

跑满的分数,反而说明基准已经失效

Berkeley RDI 在基准测试过程中系统记录了当前 Agent 的失败模式:幻觉导航(凭空"记忆"出不存在的页面元素,点击空气)、长链遗忘(超过 10 步后早期任务目标常被遗忘)、视觉依赖脆弱(页面 UI 稍有改动,成功率大幅下降),以及最尖锐的一条——刷榜问题:部分基准被训练数据污染,100% 分数反而说明失效,不代表真正能力。这意味着团队必须持续推出更难、更贴近真实场景的基准版本,否则"分数上升"这件事本身就可能只是 Goodhart 定律的又一次应验。

WebArena 系列的影响力越大,这种张力就越尖锐:全球主流 LLM 实验室都把 WebArena 成绩列入模型评估体系,一个基准比十篇论文更能影响研究方向——但这也意味着一旦基准被针对性优化,它塑造行业注意力的能力会反过来掩盖真实能力的停滞。团队正在把 Agent 在模拟环境中的探索轨迹用作训练下一代 Agent 的素材,评估与训练的边界正在模糊,这既能加速能力提升,也让"基准既是裁判又是教练"的利益冲突更难回避。

TinyAgent 与 WebArena 代表了两条几乎相反的路线:一条不断把评估门槛推高、逼近云端大模型的能力边界;另一条把能力压缩进 7B 小模型塞进笔记本。两条线同时出自同一个团队,说明 Berkeley 对"Agent 的下一步"没有下唯一注解——是继续扩大云端模型的能力,还是把够用的能力下放到边缘设备,这本身就是一个尚未有定论的行业级选择题。

WebArena 的价值不在于某个模型跑出了多高的分数,而在于它逼着整个行业用"真实网站+程序化验证"这把尺子说话,而不是自说自话。但 Berkeley 团队自己揭示的刷榜问题提醒所有人:基准一旦成为目标,就有被优化到失去意义的风险。这也是为什么 TinyAgent 这条"往小做"的支线同样重要——它是对"评估分数能否代表真实可用性"这个问题的另一种回答。

来源 / SOURCES
← 全部实验室索引 · DeepDive 首页

更新记录

首次发布 2026-08-17