跳到正文
← DeepDive 实验室与建设者 ·
← DeepDiveUNIVLAB · A04 · 2026 · AUG 17
DEEPDIVE / [UNIV LAB] · CMU OPENHANDS
v1 · 2026 · AUG 17
LAB PROFILE AI软件工程师 CARNEGIE MELLON UNIVERSITY, PA

CMU OpenHands
给AI一台真机器,而不是一个沙盘

OpenHands 是 CMU 团队发起的开源 AI 软件开发 Agent 平台——它不只是"写代码的 AI",而是可以执行 Bash 命令、浏览网页、调试报错、提交 PR 的完整软件工程 Agent,在 SWE-bench 上长期保持全球第一。

类型 / TYPE
大学研究实验室(已孵化独立公司)
领域 / FOCUS
AI 软件工程 Agent / SWE-bench
总部 / HQ
CMU NLP Group(匹兹堡, PA)
成立 / FOUNDED
2024 年 3 月
规模 / TEAM
180+ 名开源社区贡献者
融资 / FUNDING
All Hands AI 获 Madrona Ventures 等机构融资(未公开金额)
状态 / STATUS
活跃 · SWE-bench 全球第一 · GitHub 31,000+ Star
最后核实 / VERIFIED
2026-08-17
§ 01 / 是什么

从"写代码片段"到"做完整的软件工程"

GitHub Copilot 让 AI 帮程序员写代码片段,但这只是软件工程的一小部分——一个真正的软件工程师需要读懂需求、定位问题、实现方案、运行测试验证结果、写 commit message 提交代码。2023 年之前,没有任何系统能把这条完整链条打通。2024 年 3 月,CMU 计算机系教授 Graham Neubig 联合博士生 Xingyao Wang、工业界背景的 Robert Brennan 发起了这个项目,最初名为 OpenDevin,后更名为 OpenHands,起点很简单:"AI 应该能像人类开发者一样操作电脑完成软件开发任务"。

项目发布后迅速走红:180+ 名社区贡献者加入,GitHub 积累超过 31,000 Star,成为开源 AI Agent 领域影响力最大的项目之一。它最关键的设计决策是给 Agent 一个真实的操作系统环境而不是模拟——Agent 在 Docker 容器中运行,Controller(LLM 驱动的规划模块)可以调用完整的动作空间:执行 Bash 命令、读写文件、进行浏览器操作、执行 Python 代码、与用户交互,观察结果后返回 Controller 继续规划。容器隔离在保证安全的同时,让 Agent 可以安装依赖、运行测试、查看日志,完全模拟真实开发环境。

OpenHands 通过 LiteLLM 支持 100+ 种模型后端,包括 GPT-4o/o1、Claude 3.5 Sonnet/3 Opus、Gemini 1.5 Pro 及 Llama、Qwen、DeepSeek 等本地模型。面对真实项目动辄数万行代码、无法全部读入上下文的问题,它用 tree-sitter 构建代码结构图、向量检索最相关的代码文件、压缩上下文,并维护一个结构化"工作记忆"记录当前任务目标、已做操作、文件状态和关键发现。

§ 02 / 关键事实

SWE-bench:软件工程 Agent 的奥运会

SWE-bench 由普林斯顿大学 Carlos Jimenez 等人创建,从 GitHub 真实项目中抽取已解决的 issue:数据集包含 2,294 个真实 bug 修复任务,来自 Django、Flask、NumPy 等 12 个主流 Python 项目,Agent 需要读懂 issue 描述、找到相关代码、写出正确 patch,评估完全自动化——运行原始测试套件,通过即算成功,没有简化的玩具问题。Graham Neubig 表示 OpenHands 在 SWE-bench Full(全部 2,294 题)上创造了全球第一的纪录,在 SWE-bench Verified(500 题精选子集)上成功率约 40-45%,处于同级别领先位置。

SWE-bench 本身也在持续演化,CMU 团队与合作者持续推出新版本:SWE-bench Multimodal(ICLR 2025,由 John Yang、Carlos Jimenez 等普林斯顿研究者合作发布)加入图片、UI 截图等视觉输入,检验 Agent 能否处理包含截图的 bug 报告;SWE-bench Pro 则收录 1,865 道来自 41 个活跃维护仓库的企业级问题,任务复杂度更高,用于区分"能做 demo 任务"和"真正能干活"的系统差距。

2024 年,Graham Neubig 联合创立了 All Hands AI 公司,以 OpenHands 为核心产品,获得 Madrona Ventures 等机构融资——这是顶尖高校实验室直接孵化 Agent 公司的典型案例。公司定位是"AI 软件开发 Agent 的操作系统",让企业可以在自己的代码库上部署 OpenHands,处理 bug 修复、功能开发、代码重构等日常软件工程任务。

§ 03 / 张力与判断

SWE-bench 证明的,和它没能证明的

SWE-bench 的成绩清晰展示了当前 Agent 能做什么(修复有明确测试用例的 bug),也划出了它做不到什么的边界——需要架构决策、涉及产品判断、没有现成测试可以验证对错的复杂功能开发。SWE-bench Pro 的出现本身就是对这个边界的承认:企业级、41 个活跃维护仓库的问题被单独拎出来,正是因为原版 SWE-bench 的"能做 demo 任务"和现实开发的"真正能干活"之间存在落差。全球第一的头衔精确成立于一个具体基准之内,读者需要清楚这个头衔的边界在哪里。

从 CMU 实验室到 All Hands AI 公司,不到一年——这个速度既是开源 Agent 平台学术-产业最短路径的证明,也带来了治理层面的张力:一个由 180+ 名志愿贡献者共同维护的开源项目,创始人同时创立了以它为核心产品的风投背书公司,开源社区的路线图优先级和公司的商业化优先级会不会长期一致,这是所有"实验室孵化公司"模式都要面对、但材料中未给出答案的问题。

180+ 贡献者的社区规模是 OpenHands 相对单一实验室的独特优势——迭代速度远超任何闭门开发的系统,但这种规模也意味着代码质量、方向一致性依赖比传统学术项目更复杂的协调机制,尤其是在项目已经承载一家风险投资公司业务预期的情况下。

OpenHands 最有说服力的地方,不是"全球第一"这四个字,而是它选择用可自动验证的真实 GitHub 问题作为评估标准——这让"AI 软件工程师"第一次有了可审计的及格线。但 SWE-bench Pro 的诞生和"全球第一"仅限于 Full 榜单的限定词都在提醒:这条及格线目前只覆盖"有明确测试的 bug 修复",距离真正意义上的软件工程师,还有 SWE-bench 本身也承认尚未覆盖的一段路。

来源 / SOURCES
← 全部实验室索引 · DeepDive 首页

更新记录

首次发布 2026-08-17