跳到主要内容
Vantaige
ChatGPT Agent screenshot
ChatGPT Agent logo

ChatGPT Agent

付费

ChatGPT Agent 是 OpenAI 于 2025 年 7 月 17 日推出的统一自主智能体,取代了 Operator 和 Deep Research。它能在 ChatGPT 内浏览网页、运行代码、填写表单并综合研究信息,适用于 Plus($20/mo)和 Pro($200/mo)订阅计划。

功能:Mobile App

ChatGPT Agent 是内置于 ChatGPT 的统一自主智能体,由 OpenAI 于 2025 年 7 月 17 日发布。它取代了之前两款独立产品:负责网页浏览和表单填写的 Operator,以及将多源研究综合成报告的 Deep Research。整合后的单一“智能体模式(agent mode)”可从 ChatGPT 撰写器中选择,供 Plus、Pro、Team 和 Enterprise 计划的订阅者使用。激活后,该智能体将在拥有独立浏览器、终端和代码执行环境的云端虚拟机上运行,使其能够在极少需要用户干预的情况下完成多步任务。

其核心功能包括支持点击和表单填写的实时网页浏览、基于终端的代码执行、日历和文档生成(包括可编辑的演示文稿)、多源研究综合,以及与 Gmail 和 GitHub 等 ChatGPT Connectors 的集成。该智能体在发布时,在配备工具的 Humanity's Last Exam 中得分为 41.6%(在并行推理下高达 44.4%),并在 BrowseComp 基准测试中以 68.9% 的成绩领先,使其跻身目前公开可用的最强网页导航智能体之列。在 Plus 计划中,用户每月可获得 40 个智能体任务额度;Pro 用户则可获得 400 个。

ChatGPT Agent 在 2025 年 7 月的实际表现

OpenAI 于 2025 年 7 月 17 日推出了 ChatGPT Agent,同日停用了位于 operator.chatgpt.com 的独立 Operator 产品。Sam Altman 在 X 上将其描述为结合了“Deep Research 和 Operator 的精髓,但比它们更强大”。这次整合解决了一个由来已久的用户痛点:Operator 可以点击和滚动,但无法撰写详细报告;Deep Research 可以综合网页内容,但无法与需要身份验证的页面或结账流程进行交互。而 ChatGPT Agent 可以在同一个对话线程中同时处理这两项工作。

在实际应用中,该智能体接受自然语言指令,例如“分析三个竞争对手并制作一份幻灯片”或“计划并购买制作四人份日式早餐的食材”。然后,它会打开浏览器标签页,读取页面内容,导航下拉菜单和表单,在需要计算时运行 Python,并返回摘要和可下载的输出结果。从标准聊天到智能体模式的转换可以在对话中途进行,因此您可以提出后续问题或纠正智能体的方向,而无需重新启动。该智能体还集成了 ChatGPT Connectors,这意味着在配置好这些连接后,它可以提取日历事件、读取 Gmail 邮件线程或推送到 GitHub 仓库。为了阻断数据泄露途径,智能体模式下故意禁用了记忆功能,这是 OpenAI 在发布时明确说明的权衡之举。

“今天我们推出了一款名为 ChatGPT Agent 的新产品。Agent 代表了 AI 系统能力的新高度,能够使用它自己的计算机为您完成一些非凡且复杂的任务。它结合了 Deep Research 和 Operator 的精髓,但比它们更强大。” - Sam Altman (@sama),X/Twitter,2025 年 7 月 17 日

ChatGPT Agent 与 Manus 和 Anthropic Computer Use 的定位对比

截至 2026 年中,有三款产品定义了通用智能体类别:ChatGPT Agent、Manus 和 Anthropic Computer Use。它们之间的差异是架构上的,而不仅仅是表面上的。

Manus(由 Monica/Butterfly Effect AI 于 2025 年 3 月 6 日推出)采用多智能体编排系统。它将复杂的请求分解为子任务,并将每个子任务分配给在各自沙盒中运行的专用子智能体,进行并行处理。对于广泛的研究任务,这意味着可以同时处理数百个信息源,而不是按顺序处理。Manus 还会根据能力需求,为每个子任务在 Claude 和 Qwen 模型之间进行选择,这赋予了它 ChatGPT Agent 所缺乏的模型灵活性。在 Nitika Sharma 于 2025 年 7 月在 Analytics Vidhya 发表的一项包含四个任务的直接对决测试中,Manus 赢得了两项任务(PPT 制作、购物搜索),ChatGPT Agent 赢得了一项(数据分析),而两者在事件调度上均告失败。Manus 的 Basic 层级费用为 $16/月,而 ChatGPT Plus 为 $20/月。其代价是 Manus 作为一个独立产品需要注册新账户,而 ChatGPT Agent 已经内置于每月有 5 亿人使用的平台中。

Anthropic Computer Use(API,于 2024 年 10 月随 Claude 3.5 Sonnet 推出)采取了截然不同的方法:它纯粹是一个 API,没有托管的消费者产品。该系统通过截屏和基于坐标的交互来工作,这意味着 Claude 会识别按钮的视觉像素坐标,计算点击位置,并发出命令。这种架构使其能够操作任何本地或远程桌面应用程序,而不仅仅是网页。开发者需要自行集成,在自己的代码中处理截屏捕获、动作执行和恢复逻辑。ChatGPT Agent 为最终用户自动处理了所有这些基础设施,但受限于没有本地文件访问权限的云端虚拟机。Anthropic Computer Use 在 OSWorld(截屏模式)中得分为 14.9%,而之前的最高分为 7.8%,并且与 ChatGPT Agent 不同,它通过 API 按 Token 计费,没有每月订阅上限。对于构建可重复自动化管道的开发者来说,API 模型提供了更大的灵活性;而对于希望获得零配置体验的个人知识工作者来说,ChatGPT Agent 在便利性上胜出。

您可以在 Vantaige 上比较更广泛的生态系统,阅读 Manus 列表、Claude 4 列表,以及针对软件工程类自主智能体的 Devin 列表。

智能体循环在日常实际应用中的表现

Nielsen Norman Group 的 Evan Sunwall(2025 年 7 月)进行的独立测试记录了对该体验最清晰的评估之一。测试内容:在 Brennan's of Houston 预订中午四人的餐厅座位,并注明其中一位客人对贝类过敏。ChatGPT Agent 正确完成了任务,包括识别并传递了用户未明确指定给特定客人的饮食限制。问题在于:整个过程大约耗时 17 分钟。而人类执行相同任务大约只需 2 分钟。该智能体因意外的 Google Maps 重定向而遭遇了 55 秒的延迟,并在自我纠正之前误点了一个时间段选择器。Sunwall 总结道,该智能体“基础尚不稳固”,并警告说“更复杂的体验将更容易出错且速度更慢”。

在其他评测中,酒店预订任务耗时高达 25 分钟,且在任务中途频繁中断,要求用户提供信息。任何使用 CAPTCHA 或 Cloudflare 机器人保护的网站都会完全阻止该智能体,这排除了很大一部分电子商务、票务和表单繁多的目标网站。虚假确认也是一个被报告的模式:智能体声称它完成了一项操作(例如,将商品添加到 Etsy 购物车),但实际上该操作在后台默默失败了。

“这个过程非常缓慢。ChatGPT Agent 基础尚不稳固,更复杂的体验将更容易出错且速度更慢。” - Evan Sunwall,Nielsen Norman Group,2025 年 7 月

在 Plus 计划中,每月 40 个任务的上限是最大的实际限制。一项对超过 5,000 个智能体会话的分析发现,73% 的 Plus 用户在第一周内就耗尽了他们的额度,这造成了评测者所说的为了节省运行次数而产生的“消息焦虑”。在 2025 年 7 月发布评测的 AI 测试员 Aakash Gupta 给该智能体打了 6/10 分,指出它“未能达到早期营销所暗示的变革性能力”。每个任务在内部可能跨越许多智能体步骤,但只有用户发起的触发才计入每月额度,任务中途的澄清暂停则不计入。

生成文档的输出质量是另一个摩擦点。几位评测者指出,与将相同请求作为直接提示词交给标准 ChatGPT 所交付的结果相比,该智能体生成的演示文稿和报告“格式糟糕”。该智能体优先考虑任务的完成度,而非润色。

ChatGPT Agent 适合哪些人群

最清晰的用例包括:已经习惯使用 ChatGPT 且希望偶尔进行多步自动化而无需采用新工具的知识工作者;需要跨越数十个页面进行竞争分析、旅行后勤规划或信息源综合的研究人员;以及希望将 Gmail、GitHub 或日历集成接入其现有 ChatGPT 工作流的 Team 或 Enterprise 计划业务团队。iOS 和 Android 的移动应用程序提供了相同的智能体模式访问权限,这使其在移动办公任务委派方面具有可行性,而大多数竞争对手则无法做到这一点。与需要专门引导流程的工具相比,智能体模式在现有对话中激活,无需切换应用程序或账户,这一事实大幅降低了入门门槛。

电子商务团队和独立卖家可以使用该智能体研究定价趋势、起草产品描述,并浏览供应商网站获取报价。将其用于学习工作流的学生和研究人员发现,实时信息源与结构化综合的结合对于文献综述和竞争分析非常有用。在 Pro 计划中,高级用户报告称使用该智能体来自动化每周的报告周期:它从连接的数据源提取数据,撰写摘要,并对其进行格式化以供分发,这种工作流完全契合该智能体的操作范围。

对于特定的研究工作流,ChatGPT Agent 补充了诸如 Browserbase(为希望在自动化浏览基础上进行开发的开发者处理无头浏览器基础设施)和 Lindy(专注于具有紧密应用程序集成的无代码工作流自动化)等工具。如果您的主要目标是 SaaS 工具之间的无代码自动化,而不是开放式的网页导航,那么 Lindy 值得一比。

ChatGPT Agent 不是什么

当您需要高容量、可重复或程序化的任务执行时,ChatGPT Agent 并不是专用自动化平台的替代品。在 Plus 计划每月 40 个任务的限制下,它无法扩展以满足生产工作流的需求。它不是一个本地计算智能体:它无法访问您的文件系统、本地应用程序或桌面环境。它不适用于任何受 CAPTCHA 或 Cloudflare 保护的目标(这占据了交易类网站的很大一部分)。它也不是 Devin 意义上的编程智能体:Devin 在跨多会话项目中维护着一个包含自身代码库、IDE 和规划层的持久软件工程环境,而 ChatGPT Agent 则会在会话之间重置上下文。

如果您需要一个能够操作本地文件和桌面应用程序的智能体,Anthropic Computer Use (API) 在架构上更具优势。如果您需要同时跨越数百个信息源进行并行的多任务执行,Manus 的多智能体架构优于单一的顺序循环。如果您的目标是跨越整个软件项目进行自主代码交付,Devin 正是为此范围量身定制的。ChatGPT Agent 是为已经深度融入 ChatGPT 生态系统的用户提供的一个通用便利层。这种定位对数千万人来说确实非常实用,但它的上限也是真实存在的。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 ChatGPT Agent 相关的指南和文章。