OpenHands 是 CMU 团队发起的开源 AI 软件开发 Agent 平台——它不只是"写代码的 AI",而是可以执行 Bash 命令、浏览网页、调试报错、提交 PR 的完整软件工程 Agent,在 SWE-bench 上长期保持全球第一。
GitHub Copilot 让 AI 帮程序员写代码片段,但这只是软件工程的一小部分——一个真正的软件工程师需要读懂需求、定位问题、实现方案、运行测试验证结果、写 commit message 提交代码。2023 年之前,没有任何系统能把这条完整链条打通。2024 年 3 月,CMU 计算机系教授 Graham Neubig 联合博士生 Xingyao Wang、工业界背景的 Robert Brennan 发起了这个项目,最初名为 OpenDevin,后更名为 OpenHands,起点很简单:"AI 应该能像人类开发者一样操作电脑完成软件开发任务"。
项目发布后迅速走红:180+ 名社区贡献者加入,GitHub 积累超过 31,000 Star,成为开源 AI Agent 领域影响力最大的项目之一。它最关键的设计决策是给 Agent 一个真实的操作系统环境而不是模拟——Agent 在 Docker 容器中运行,Controller(LLM 驱动的规划模块)可以调用完整的动作空间:执行 Bash 命令、读写文件、进行浏览器操作、执行 Python 代码、与用户交互,观察结果后返回 Controller 继续规划。容器隔离在保证安全的同时,让 Agent 可以安装依赖、运行测试、查看日志,完全模拟真实开发环境。
OpenHands 通过 LiteLLM 支持 100+ 种模型后端,包括 GPT-4o/o1、Claude 3.5 Sonnet/3 Opus、Gemini 1.5 Pro 及 Llama、Qwen、DeepSeek 等本地模型。面对真实项目动辄数万行代码、无法全部读入上下文的问题,它用 tree-sitter 构建代码结构图、向量检索最相关的代码文件、压缩上下文,并维护一个结构化"工作记忆"记录当前任务目标、已做操作、文件状态和关键发现。
SWE-bench 由普林斯顿大学 Carlos Jimenez 等人创建,从 GitHub 真实项目中抽取已解决的 issue:数据集包含 2,294 个真实 bug 修复任务,来自 Django、Flask、NumPy 等 12 个主流 Python 项目,Agent 需要读懂 issue 描述、找到相关代码、写出正确 patch,评估完全自动化——运行原始测试套件,通过即算成功,没有简化的玩具问题。Graham Neubig 表示 OpenHands 在 SWE-bench Full(全部 2,294 题)上创造了全球第一的纪录,在 SWE-bench Verified(500 题精选子集)上成功率约 40-45%,处于同级别领先位置。
SWE-bench 本身也在持续演化,CMU 团队与合作者持续推出新版本:SWE-bench Multimodal(ICLR 2025,由 John Yang、Carlos Jimenez 等普林斯顿研究者合作发布)加入图片、UI 截图等视觉输入,检验 Agent 能否处理包含截图的 bug 报告;SWE-bench Pro 则收录 1,865 道来自 41 个活跃维护仓库的企业级问题,任务复杂度更高,用于区分"能做 demo 任务"和"真正能干活"的系统差距。
2024 年,Graham Neubig 联合创立了 All Hands AI 公司,以 OpenHands 为核心产品,获得 Madrona Ventures 等机构融资——这是顶尖高校实验室直接孵化 Agent 公司的典型案例。公司定位是"AI 软件开发 Agent 的操作系统",让企业可以在自己的代码库上部署 OpenHands,处理 bug 修复、功能开发、代码重构等日常软件工程任务。
SWE-bench 的成绩清晰展示了当前 Agent 能做什么(修复有明确测试用例的 bug),也划出了它做不到什么的边界——需要架构决策、涉及产品判断、没有现成测试可以验证对错的复杂功能开发。SWE-bench Pro 的出现本身就是对这个边界的承认:企业级、41 个活跃维护仓库的问题被单独拎出来,正是因为原版 SWE-bench 的"能做 demo 任务"和现实开发的"真正能干活"之间存在落差。全球第一的头衔精确成立于一个具体基准之内,读者需要清楚这个头衔的边界在哪里。
从 CMU 实验室到 All Hands AI 公司,不到一年——这个速度既是开源 Agent 平台学术-产业最短路径的证明,也带来了治理层面的张力:一个由 180+ 名志愿贡献者共同维护的开源项目,创始人同时创立了以它为核心产品的风投背书公司,开源社区的路线图优先级和公司的商业化优先级会不会长期一致,这是所有"实验室孵化公司"模式都要面对、但材料中未给出答案的问题。
180+ 贡献者的社区规模是 OpenHands 相对单一实验室的独特优势——迭代速度远超任何闭门开发的系统,但这种规模也意味着代码质量、方向一致性依赖比传统学术项目更复杂的协调机制,尤其是在项目已经承载一家风险投资公司业务预期的情况下。
OpenHands 最有说服力的地方,不是"全球第一"这四个字,而是它选择用可自动验证的真实 GitHub 问题作为评估标准——这让"AI 软件工程师"第一次有了可审计的及格线。但 SWE-bench Pro 的诞生和"全球第一"仅限于 Full 榜单的限定词都在提醒:这条及格线目前只覆盖"有明确测试的 bug 修复",距离真正意义上的软件工程师,还有 SWE-bench 本身也承认尚未覆盖的一段路。
首次发布 2026-08-17