跳到主要内容
Vantaige
OpenHands screenshot
OpenHands logo

OpenHands

免费增值

OpenHands 是由 All Hands AI 开发的开源自主 AI 编程智能体。它能在沙盒环境中规划、编写、执行和调试代码,无需在每个步骤进行人工审批。支持免费自托管;并提供云端版本。

功能:APIOpen Source

OpenHands 是一个用于自主 AI 软件开发智能体的开源平台,由 All Hands AI(2024 年成立于旧金山)构建和维护。大多数编程助手仅作为自动补全工具或交互式结对程序员,而 OpenHands 则运行一个完整的自主循环:智能体在 Docker 沙盒环境中规划、编写代码、执行 shell 命令、浏览网页,并对其自身的输出进行迭代。该项目最初于 2024 年 3 月以 OpenDevin 的名称在 GitHub 上发布,在六个月内获得了 50,000 颗星,随后在 2024 年 9 月 All Hands AI 获得由 Menlo Ventures 领投的 500 万美元种子轮融资时,更名为 OpenHands。截至 2026 年 5 月,该项目已拥有超过 72,500 颗 GitHub 星标,发布了 102 个版本,并于 2026 年 5 月 1 日发布了稳定的 v1.7.0 版本。

该平台与模型无关:用户可以提供 Claude、GPT-4o、Gemini、DeepSeek 或任何兼容 OpenAI 端点的 API 密钥。核心功能包括集成了 BrowserGym 的网页自动化、基于 Jupyter 的代码执行、Git 和 GitHub/GitLab API 集成、多智能体任务委派,以及用于编程式控制的 REST/WebSocket API。代码库由 62% 的 Python 和 36% 的 TypeScript 组成。在 MIT 许可证下,自托管是免费的。openhands.dev 上的云产品提供免费的个人版(每天 10 次对话)和每月 20 美元的 Pro 版(具有更高的额度并支持自带密钥),此外还有提供私有 VPC 部署和 SAML/SSO 的企业版。

2026 年 4 月的 OpenHands 实际能做什么

OpenHands 不是一个代码建议引擎。智能体接收任务(通常是 GitHub issue 的 URL、自然语言规范或失败的测试套件),然后自主处理每个步骤:读取代码库、编写修复程序、运行测试、调试故障并推送提交。它可以浏览文档、运行任意 bash 命令、调用外部 API,并生成子智能体以并行化工作。Web UI 提供了一个实时操作面板,显示智能体执行的每个命令,让开发者能够观察和中断,而不会被迫在每个微小步骤中进入审批循环。

其架构以事件流模型为中心。每个操作(写入文件、运行 bash、点击浏览器元素)都会被记录为结构化事件,智能体可以重放或引用这些事件。Docker 隔离意味着智能体在每个会话中都在一个干净、短暂的环境中运行,这限制了错误命令的破坏范围,并使运行具有可重复性。容器内的 SSH 访问权限使智能体能够处理几乎任何 Unix 工具链,而无需特殊的集成工作。

在 SWE-bench Verified 基准测试中,OpenHands 的基准得分为 60.6%,在推理时间扩展(2025 年 4 月 17 日的博客文章)下得分为 66.4%,使其成为当时该排行榜上顶尖的开源系统。作为背景参考:像 Devin 这样的闭源商业系统在 2024 年首次发布时得分约为 13.9%,尽管此后架构和基准测试都发生了重大演变。基准测试分数衡量的是解决真实 GitHub issue 的性能,而不是玩具任务,这就是为什么从业者在选择工具时会引用这些分数。

“现在 OpenHands 代码库中约 20% 的提交是由 OpenHands 自己编写或共同编写的。我们离 AI 能够取代软件工程师的程度还差得很远。但它非常擅长推动现有的 PR 顺利完成。” - rbren(All Hands AI 首席执行官 Robert Brennan),Hacker News,2025 年 1 月 17 日

2025 年 11 月的云端重新设计引入了更简洁的起始页、工作区的全屏模式、可扩展的提示词输入区,以及 UI 内直接的 git 控制(推送、拉取、创建 PR)。同一更新将云端定价从 Claude API 成本的 2 倍降至无加价的透传费率,并增加了多模型支持,因此云端用户不会被锁定在单一供应商。

OpenHands 与 Devin 和 SWE-Agent 的定位对比

最重要的比较不是逐个功能的对比,而是架构上的:每种工具服务于什么样的开发者工作流?

OpenHands vs. Devin(Cognition AI,闭源):Devin 是一个完全托管的 SaaS 产品,没有自托管选项。定价为每月 500 美元起,目标客户是希望获得开箱即用的智能体开发者而无需管理基础设施的企业工程团队。Devin 运行在 Cognition 自己的云环境中;除非 Cognition 公开,否则您无法了解智能体的执行循环。OpenHands 则完全颠覆了这一点:代码是公开的,执行在本地或您自己的云端进行,您可以检查流中的每个事件,并且您只需支付 LLM 供应商的 API 费率。对于需要数据主权、可审计性,或者仅仅是无法为早期工具证明每月 500 美元合理性的团队来说,OpenHands 是可靠的替代方案。代价是 OpenHands 需要 Docker、API 密钥管理,以及偶尔调试智能体的环境设置,而 Devin 用户则不会遇到这些问题。

OpenHands vs. SWE-Agent(Princeton NLP,开源):SWE-Agent 首先是一个研究项目,其次才是一个生产工具。它通过 pip 安装,完全在 CLI 中运行,并围绕为 SWE-bench 基准任务构建的智能体-计算机接口(ACI)抽象层进行设计。它没有 Web UI,没有多智能体委派,没有 BrowserGym 集成,也没有企业支持路径。SWE-Agent 在 SWE-bench Mini 配置上的得分约为 74%,在范围狭窄的基准任务上与 OpenHands 具有竞争力。但对于在具有非标准工具链、真实 CI/CD 环境和不同 issue 复杂性的真实代码库上运行它的团队来说,OpenHands 的 Docker 隔离、Web UI 可观察性和活跃的生产维护赋予了它显著的实用优势。SWE-Agent 是研究人员对智能体架构进行基准测试的正确选择;而 OpenHands 则是希望交付代码的工程团队的正确选择。

还有两个工具值得放在此背景下讨论。Aider 是一个交互式 CLI 结对程序员,它使每个更改都成为经过审查的 Git diff,使用 repo-map 策略将大型代码库压缩为高效利用 token 的摘要。您在每一步都保持控制权。Cursor 是一个具有深度内联 AI 集成的 VS Code 分支,最适合希望在编辑器内获得 AI 协助而不是单独的自主智能体的开发者。OpenHands 在自主性和范围上都高于两者,代价是需要更多的基础设施和结果的更大差异性。

智能体循环的真实情况

在 HN 帖子、Medium 文章和该项目自己的博客中记录的最可靠的 OpenHands 工作流是 PR 收尾:开发者打开一个 GitHub PR,与智能体共享 URL,然后 OpenHands 克隆代码库,读取失败的 CI 检查,修复问题并推送提交。这是一个范围明确、定义良好的任务,具有清晰的成功标准(通过测试),这正是自主智能体表现最好的地方。

批量微服务升级是另一个记录在案的成功模式。一位 Medium 作者在微服务列表中运行 OpenHands 进行依赖项升级,每项服务支付约 3 美元,并在执行其他任务时在后台完成工作。虽然不是零成本,但可能比手动执行更快。关键的先决条件是每项服务都有良好的测试;如果没有通过测试作为成功信号,智能体就没有可靠的停止标准,并且会在收益递减的情况下继续迭代。

“我不明白机密信息怎么会不出现在聊天或终端中。OpenHands 现在对机密信息没有适当的支持。” - M. Chechulin,Medium,2025 年(注:随后在 v0.42 中添加了对机密信息的支持)

循环崩溃的地方:模糊或开放式的任务。要求智能体“为这个应用添加深色模式”而没有规范、组件清单或定义的验收标准,会导致规划漂移,智能体会生成看起来合理但不符合您要求的代码,然后循环尝试修复它引入的测试失败。一位 Hacker News 评论者描述了在跨多个文件添加许可证标头时,发现智能体犯了一个微妙的编辑错误,悄悄地删除了几个源文件中的最后一句话。这些悄无声息的错误比明显的失败更难被发现,因为它们通过了自动化测试。

成本的不可预测性是另一个现实考验。微不足道的单文件修复需要 0.05 到 0.30 美元的 LLM API 费用。经过多次迭代的真正错误修复需要 0.50 到 3 美元。解决模糊问题的复杂数小时会话可能会达到 10 到 30 美元。自托管版本中没有内置的硬性成本上限,因此在配置错误或模糊的任务上循环的智能体可能会在您注意到之前消耗大量的 API 预算。

研究人员 Johann Rehberger 于 2025 年 8 月 9 日披露的提示词注入安全漏洞值得企业在评估时注意。披露的攻击允许通过恶意制作的图像 URL 零点击窃取用户的 GITHUB_TOKEN 和聊天记录。All Hands AI 于 2025 年 3 月 13 日收到通知;148 天后才公开披露。将 OpenHands 集成到处理不受信任内容的自动化流水线中的团队,应在部署前审查当前的补丁状态。

在实践中与 OpenHands 搭配良好的工具:在人工审查阶段提供内联建议的 GitHub Copilot,以及为希望获得介于 Aider 的交互式模型和 OpenHands 的完全自主性之间的 VS Code 集成智能体体验的开发者提供的 Cline。

OpenHands 是为谁构建的

OpenHands 为熟悉 Docker、拥有自己的 LLM API 密钥并根据明确规范的 GitHub issue 开展工作的后端和机器学习工程师提供了最大的价值。具有良好的 issue 卫生习惯、良好的测试覆盖率和明确的验收标准的团队将看到最高的成功率。企业版面向需要具有 RBAC、SSO 和 Kubernetes 部署的自托管、可审计智能体平台的组织,在这些用例中,向 Cognition 支付每月 500 美元购买 Devin 是不可行的,并且运行商业 SaaS 会受到数据治理要求的阻碍。

研究人员是一个主要的用户群体。该项目是多个学术基准测试的参考平台,包括 SWE-bench Verified、Multi-SWE-Bench 和 LiveSWEBench。ICLR 2025 论文(于 2025 年 2 月被接收)正式描述了该架构。如果您正在评估智能体架构,OpenHands 是最强大的可用于基准测试的开源系统。

想要尝试自主编程智能体的个人开发者可以从免费的云端版本开始,该版本允许每天使用 Minimax 模型进行 10 次对话,无需 API 密钥。在投入 Docker 设置和 API 成本之前,这是一条合理的评估路径。

OpenHands 不是什么

OpenHands 不是一个人在回路(human-in-the-loop)的工具。如果您想在每次更改进入代码库之前对其进行审查,Aider 是更好的选择:每个操作都是一个 diff,每个提交都需要批准,并且该工具是明确围绕这种交互模型设计的。OpenHands 将自主运行并推送提交;这是设计使然,而不是缺陷。

在复杂、开放式的产品功能上,它不能直接替代开发者。创始人直言不讳地表示:智能体还远不能取代软件工程师。它擅长定义良好、可通过测试验证的任务。模糊的产品工作、跨领域的架构决策,以及任何需要在较长时间跨度内进行持续判断的工作,在 2026 年都超出了其可靠的运行范围。

它不适合没有 Docker 的环境。沙盒执行模型是智能体运行方式的核心,而不是可选的部署选择。在没有容器支持的受限基础设施上的团队在评估该工具之前,应将该设置成本纳入计划。

最后,如果您大规模使用它,它并不是一个零成本的工具。“免费和开源”指的是软件许可证和没有供应商订阅费。您仍然需要向您的 LLM 供应商付费。在复杂的任务上,这种成本是真实且可变的。请据此做好预算。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 OpenHands 的精选合集。

相关文章

与 OpenHands 相关的指南和文章。