

OpenAI Codex CLI 是一款开源的终端智能体,能够读取您的代码库、编辑文件,并在操作系统级别的沙盒中运行 shell 命令。该工具于 2025 年 4 月发布,采用 Rust 重写,并在 Apache 2.0 许可下免费提供。
OpenAI Codex CLI 是由 OpenAI 于 2025 年 4 月 16 日在 Apache 2.0 许可下发布的一款开源、原生于终端的编程智能体。它在您的 shell 中本地运行,读取工作目录中的文件,编辑代码并执行命令,通过 OpenAI 的 API 进行任务推理。其代码仓库位于 github.com/openai/codex,截至 2026 年 4 月,已获得超过 74,000 个 GitHub 星标,每月 npm 下载量超过 1400 万次。与 GitHub Copilot 或 Cursor 等嵌入 IDE 的助手不同,Codex CLI 不需要编辑器插件,并且可以与任何在终端中运行的文本编辑器或工作流配合使用。
该 CLI 提供了三种沙盒审批模式、支持并行工具调用的模型上下文协议 (MCP) 集成、用于自定义会话逻辑的实验性钩子引擎、用于自动差异分析的内置 /review 命令,以及通过 codex resume 实现的跨会话上下文恢复功能。它最初使用 TypeScript 编写,随后在 2025 年 6 月几乎完全用 Rust 进行了重写,将启动时间和内存占用降至约 80MB。当前的默认模型是 GPT-5.5;用户可以在会话中途使用 /model 命令切换到 GPT-5.4(1M token 上下文)或 GPT-5.3-Codex。身份验证可通过 ChatGPT 订阅(Plus、Pro、Business)或单独的 OpenAI API 密钥进行。
OpenAI Codex CLI 在 2026 年 5 月的实际表现
Codex CLI 作为一个本地循环运行:您用自然语言描述任务,智能体读取当前目录中的相关文件,规划一系列编辑和命令,根据您的审批模式展示或自动应用更改,并不断迭代直到任务完成或您进行干预。该循环完全在您的终端中运行,这意味着它可以与任何能够调用 shell 命令的 CI 流水线、git 工作流或自动化脚本集成。
沙盒机制在操作系统级别强制执行。在 Linux 上,Codex CLI 使用带有 Landlock 和 seccomp 的 bubblewrap 来限制智能体进程。在 macOS 上,它使用 Seatbelt。这是内核级别的进程隔离,而不是可以被模型本身绕过的应用层审批提示。默认的 Auto 模式允许智能体在工作目录内读取、编辑和运行命令。Read-only 模式允许其浏览,但在写入前需要人工确认。Full Access 授予网络访问权限和更广泛的系统触达范围,专为受信任的自动化流水线设计。
MCP 服务器集成通过 ~/.codex/config.toml 进行配置。Codex 在会话开始时自动启动已配置的服务器,并且至关重要的是,它会并行而非串行地发出符合条件的工具调用。OpenAI 的内部测试表明,这在多工具会话中将挂钟时间缩短了约 50%(串行 58 秒对比并行 31 秒)。该 CLI 还会读取 AGENTS.md 配置文件,这是 Cursor 和 Aider 同样使用的开放标准,这意味着拥有现有项目级上下文文件的团队无需为 Codex 维护单独的配置。
其他值得了解的命令:codex exec 以非交互方式运行智能体以实现自动化,/review 启动第二个 Codex 智能体在提交前分析差异,而 codex resume 则重新打开之前的会话并保持其上下文完整。基于 Rust 的二进制文件可通过 npm (npm install -g @openai/codex)、Homebrew 或直接从 GitHub Releases 下载二进制文件进行安装,并在 macOS 和 Linux 上的 x86_64 和 arm64 架构中运行。
Codex CLI 与 Aider 和 Claude Code 的定位对比
Aider 是该类别中历史更悠久、更成熟的终端编程智能体。它于 2023 年推出,使用 Python 编写,并且与模型无关:它通过通用接口连接到 OpenAI、Anthropic、Google 或任何本地托管的模型。Aider 的设计从根本上是以 git 为中心的。它所做的每一次编辑都会自动提交,每个会话都可以作为一个分支进行审查,整个工作流都围绕差异审查展开。Pawel Jozefiak 在 2026 年的一篇 CLI 编程智能体比较文章中指出,Aider 展示了“git 优先哲学”这一明显优势:“它更像是一个纪律严明的结对程序员,从不跳过任何一次提交。” Aider 每个任务使用的 token 数量比更重型的智能体少约 4.2 倍,这使其在重复性编辑中更具成本效益。Codex CLI 拥有而 Aider 没有的特性:操作系统级别的进程沙盒、原生的并行 MCP 工具调用以及桌面应用程序。Aider 拥有而 Codex CLI 没有的特性:模型灵活性、提供商独立性以及经过三年构建的更成熟的插件生态系统。
Claude Code 是 Anthropic 具有竞争力的终端智能体,也是最直接的比较对象。Claude Code 同样在本地运行,同样读取文件系统,并且同样作为 npm 包发布。机制上的差异很重要。Claude Code 使用应用层钩子(26 个生命周期事件)而不是操作系统级别的进程隔离。Codex CLI 的 Landlock/seccomp/Seatbelt 强制执行更为严格。另一方面,Claude Code 在 Terminal-Bench 2.0 上的基准测试得分更高:92.1%,而 Codex CLI 使用 GPT-5.3-Codex 的得分为 77.3%。Claude Code 使用具有分层上下文感知层次结构的 CLAUDE.md 配置文件;Codex CLI 使用 AGENTS.md,这是一个 Cursor 和 Aider 同样读取的开放标准,减少了团队间的配置重复。成本模型也有所不同:Claude Code 完全通过 Anthropic API 按 token 计费。Codex CLI 可以捆绑到现有的 ChatGPT 订阅中,这对于已经为 Plus 或 Pro 付费的开发者来说更便宜。Claude Code 的 Opus 4.7 以标准定价提供 1M token 上下文;Codex CLI 的 GPT-5.4 同样达到 1M token,但需要从默认的 GPT-5.5 进行切换。
Blake Crosley 在 2026 年的一项直接安全比较分析中发现,在一次 FastAPI 代码审查测试中,Opus 4.7 识别出了密码比较中的时序侧信道漏洞,而 Codex 遗漏了它,但 Codex 捕获了一个被 Claude Code 批准的 SSRF 向量。每种工具都有对方能捕捉到的盲点,这促使一些团队在合并前对同一差异同时运行这两种工具。
智能体循环的真实表现
对于包含在内的单步任务,Codex CLI 表现良好。OpenAI 员工 avital 描述了通过使用并行执行模型“在午餐前完成了 7 个中小型拉取请求”:在不同的功能分支上启动多个任务,让它们运行,然后审查 PR。swyx 在早期测试中指出,Codex 支持“每小时 60 个并发实例”,而 Devin 为 5 个,Cursor 为 1 个,这彻底改变了批量任务执行的经济性。
摩擦出现在多步链的第三或第四步。多位在 2025 年和 2026 年进行测试的开发者发现,当任务具有在较长会话中积累的相互依赖性时,Codex CLI 会失去连贯性。Jozefiak 的比较测试指出:“它很冷漠……感觉不像 Claude Code 那样在朝着某个目标构建。” 2025 年 4 月的一位 HN 用户 gklitt 在发布当天在他们的生产代码库上测试了 Codex,发现“它幻觉出了一堆代码中没有的东西,并完全曲解了架构”,凭空捏造了应用程序根本没有的 REST API 后端。CSMastermind 总结了一个常见的挫败感:“任何需要一点批判性思考的东西都会完全迷失……它就像一个糟糕的初级工程师”,在“没有监督的情况下会很快制造技术债务”。
速率限制是一个真实的运营问题。在 Plus 层级($20/月),滚动的 5 小时限制消耗速度比大多数用户预期的要快。在 OpenAI 于 2026 年 4 月 9 日更新限制计算方式后,社区论坛出现了大量投诉。Sasha123 写道:“在 5 小时限制更改后,我能做的事情比一周前少了大约 10 到 15 倍。” milesdr 报告说:“7 个提示在 10 分钟内用光了我整个 5 小时的限制。” 重度使用实际上需要 $200/月的 Pro 层级。这使得 Codex CLI 的实际成本与 Claude Code 在重度 API 工作流中的成本大致相当,尽管它的起步价是“免费”的。
“在 5 小时限制更改后,我能做的事情比一周前少了大约 10 到 15 倍。” - Sasha123,OpenAI 社区论坛,2026 年 4 月 4 日
“目前它绝对比 Claude Code 差,但我希望它能通过开源贡献得到改进。” - mgdev,Hacker News,2025 年 4 月 16 日
代码库搜索性能问题值得单独指出。在大型仓库中,Codex 在执行目标函数搜索时有时会加载不必要的相邻文件上下文,在专用子智能体 5 秒内即可处理的任务上运行类似 grep 的操作长达 75 秒。对于拥有大型单体仓库的项目,这直接转化为速率限制的消耗和更慢的迭代周期。codex resume 功能和 AGENTS.md 作用域指令有助于管理这一问题,但无法完全消除。
Codex CLI 是为谁打造的
已经为 ChatGPT Plus 或 Pro 付费的开发者可以将 Codex CLI 作为其订阅的一部分,这是一个极具吸引力的价值主张。如果您已经在使用 $200/月的 Pro,那么在不增加额外成本的情况下添加一个功能强大的终端智能体,与单独为 Claude Code 的 API 使用付费相比,将显著改变经济效益。已经在 Cursor 或 Cline 的 AGENTS.md 配置文件上投入精力的团队会发现,Codex CLI 无需额外设置即可读取相同的文件。
在敏感代码库上操作且注重安全的团队将受益于操作系统级别的沙盒机制。内核级别的 Landlock/Seatbelt 强制执行提供了比依赖模型遵守提示约束的应用层审批钩子更强的保证。对于受监管的环境或审计智能体行为的团队来说,受限的工作目录执行模型是一个有意义的特性。
并行执行模型适合特定的工作流:并行生成许多小型 PR 或代码审查,而不是在单个长会话中进行迭代。用户报告称,在同时跨多个隔离任务运行 Codex、将输出作为 PR 进行审查,并在除了 token 使用之外没有其他成本的情况下丢弃失败任务时,生产力最高。像 OpenHands 这样的工具采用了类似的并行任务方法,但增加了一个 Web UI 层;而 Codex CLI 则将一切保留在终端中。
Codex CLI 不是什么
如果多步骤、长时间运行的智能体会话是您的主要工作流,那么 Codex CLI 并不是 Claude Code 的替代品。Claude Code 92.1% 的 Terminal-Bench 得分与 Codex CLI 77.3% 的得分反映了在复杂、链式任务上的真实能力差距。根据多位测试人员的报告,Claude Code 在长会话中能更好地保持会话记忆,并在处理架构推理任务时表现出更高的一致性。
它不是一个与模型无关的工具。每一次 API 调用都会发送到 OpenAI 的服务器。如果您想运行 Claude 3.5 Sonnet、Gemini 2.0 Flash 或本地托管的 Llama 模型,您需要 Aider 或与提供商无关的工具框架。这不是 Codex CLI 中的配置选项,而是一个设计约束。
它不适合依赖容器化测试环境的项目。沙盒会阻止生成新容器,这意味着无法在 Codex 会话中使用 LocalStack、Docker-in-Docker 及类似的测试基础设施。alexjplant 在 2025 年 4 月的发布当天称这对于 AWS 原生应用程序来说是一个“致命缺陷”,并且这种约束依然存在。如果您的测试套件需要运行中的容器,Codex CLI 将无法自主验证其自身的编辑。
尽管带有免费开源的标签,但对于重度用户来说,它并不是一款廉价工具。代码是免费的;但推理不是。在 2026 年 4 月的速率限制更改之后,$20/月的 Plus 层级提供的余量惊人地有限。每天需要运行数十个任务的开发者将触及上限,并需要升级到 Pro($200/月)或通过 API 密钥按 token 付费,此时总成本将与 Claude Code 或 Aider 等替代方案趋同。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 OpenAI Codex CLI 的精选合集。
相关文章
与 OpenAI Codex CLI 相关的指南和文章。

Claude Code vs Cursor vs Codex vs Devin vs Replit Agent 3: 2026 Scorecard

Run a Company With AI Agents: The Open-Source Orchestration Setup (2026)

Ship Your First MCP Server in 20 Minutes (2026)

Cut Your AI Agent Token Bill 5x: The Claude Code Efficiency Patterns (2026)

Anatomy of the .claude Folder: Every File, Command, Skill & Permission (2026)
