跳到主要内容
Vantaige
Claude screenshot

Claude 始终比大多数竞争对手生成更流畅的文本和更精确的代码,但其速率限制也比市场上任何其他工具都更为严苛。以下是全方位的评测,包括 Anthropic 希望你忘记的那些事件。

功能:APIMobile AppClaude CodeProjectsArtifactsExtended ThinkingMCPComputer UseFiles

我们上传了一份 214 页的商业服务协议 PDF,并要求 Claude Opus 4.7 找出所有造成无限责任风险、带有价格递增的自动续约义务或将知识产权转让给供应商的条款。Claude 在大约 45 秒内返回了一份结构化报告,包含 11 个条款,每个条款都引用了章节号、直接引语和一段风险摘要。同样的文件在 ChatGPT 中需要分五次单独上传,并且在跨章节分析中仍然存在遗漏,而 Claude 在一次处理中就捕捉到了这些问题。

这项测试充分体现了 Claude 在 2026 年的立足之本:200K token 的上下文窗口、精确的指令遵循能力,以及被用户评价为比竞争对手更少“机器味”的写作质量。但同样是这款工具,可能会在会话中途触及使用限制,拒绝看似合理的创意提示词,并在上下文窗口技术上填满之前悄然出现连贯性下降。本篇评测将涵盖它的正反两面。

Claude 概览(2026 年 4 月)

Claude 由成立于 2021 年的 AI 安全公司 Anthropic 开发。该产品已从一个聊天界面扩展为一个平台,拥有持久的项目工作区、实时渲染的 Artifacts、终端编码智能体以及开放的集成协议。截至 2026 年 4 月,活跃的代系是 Claude 4.x:Opus 4.7(旗舰版,新的分词器每次请求可多处理高达 35% 的 token,于 2026 年 4 月 16 日发布)、Sonnet 4.6(日常主力,200K token 上下文窗口,支持扩展思考)和 Haiku 4.5(快速轻量,适合简单任务)。该平台包含 Projects、Artifacts(在侧边栏实时渲染 HTML、React、SVG 和 Mermaid 输出)、Claude Code(集成了 VS Code 和 JetBrains 的终端智能体)、网络搜索、文件上传、计算机使用(Computer Use),以及支持将 Claude Desktop 连接到 Google Drive、Slack、GitHub、Notion 和社区构建扩展的 MCP 支持。

Claude 真正擅长的领域

写作质量是用户转投 Claude 最常被提及的原因。2025 年底的开发者调查发现,大约 70% 的受访开发者在处理复杂编码任务时更倾向于使用 Claude Sonnet 4.6,这主要不是因为基准测试分数,而是因为其输出读起来像是有意图地编写的。用户形容 Gemini 偏正式,ChatGPT 能力强;而他们将 Claude 描述为听起来像是一位优秀的作家。

“Claude 写出来的东西就是让人感觉更舒服,内容更容易阅读和理解,更出色。”—— r/ClaudeAI 上的 Reddit 用户,2025 年

无需分块的长文档分析。200K 的标准上下文窗口(约 500 页)是处理法律合同、技术规范和研究文献的用户偏爱 Claude 的实际原因。上文描述的文档测试极具代表性:一次性处理 214 页的 PDF,无需拆分文件。

具备验证捕捉能力的编码精度。Claude Opus 4.6 在 SWE-bench Verified 上得分为 80.8%,达到或超过了 GPT-5.4。我们要求 Claude Opus 4.7 重构一个 580 行的 Python 数据管道,该管道混合了同步数据库调用和异步 HTTP 请求。Claude 在一次响应中返回了完整的重构代码:它隔离了数据库层,使用正确的 asyncio.gather() 模式重新包装了异步逻辑,添加了类型注解,并标记了提示词中未提及的两个竞态条件。ChatGPT 花了四条后续消息才得出类似的结果,并且仍然漏掉了其中一个竞态条件。

作为实时构建环境的 Artifacts。我们要求 Claude 构建一个交互式预算计算器,包含收入类别、支出滑块和实时储蓄率显示。Claude 在一次响应中生成了一个可运行的 React 组件,并在侧边栏实时渲染。通过三次自然语言迭代——“添加债务偿还部分”、“将图表改为环形图”、“导出为 CSV”——每一次都在几秒钟内更新了 Artifact,而无需打开代码编辑器。2025 年 10 月的更新通过内联文本替换而不是完全重新生成,使编辑速度提高了 3-4 倍,极大地改善了这一工作流。

针对困难推理任务的扩展思考。在 Opus 和 Sonnet 模型上,扩展思考(extended thinking)让 Claude 在响应之前在一个可见的草稿本中推演问题。在 GPQA Diamond(研究生水平推理)测试中,它将分数从 68% 提升到了 84.8%,这种差距在多步分析任务中至关重要。

Claude 的崩溃之处:用户不断遭遇的失败模式

速率限制是首要的、反复出现的且尚未解决的抱怨。自发布以来,这种模式每个季度都在重复:订阅者在会话中途触及使用上限,通常没有任何警告。2026 年 1 月引发了一波开发者对不明原因额度减少的抱怨;Anthropic 将其归因于假日奖励到期。

“在使用 Sonnet 的 10 到 15 分钟内,我总是会触及使用限制,使用量条显示接近 100%。”—— Claude Pro/Max 订阅者,引自《The Register》,2026 年 1 月

2026 年 3 月的 Claude Code 速率限制危机加剧了这一情况。每月支付 $100 到 $200 的 Max 级别订阅者报告称,在工作负载不变的情况下,他们在不到 90 分钟内就耗尽了 5 小时的配额。MacRumors 报道称,GitHub 上充斥着“在相同任务上 token 消耗增加 4 到 10 倍”的抱怨。Anthropic 将问题归咎于 3 月 31 日的缓存回退,同时又将更严格的限制描述为“有意的容量管理”,这种自相矛盾激怒了开发者。2026 年 4 月的一份分析指出了利害关系:“一个预算为 $240/年的工具现在将花费 $1,200/年。”

对看似完全合理的内容予以拒绝。Claude 的安全微调比 ChatGPT 更为激进。r/ClaudeAI 上的用户报告称,在创意写作、角色扮演、安全研究以及其他模型可以毫无问题地处理的假设场景中,Claude 会出现拒绝响应的情况。2025 年 9 月的 Sonnet 4.5“翻脸(Flip)”事件说明了这种情况升级的速度有多快:发布后,标题为“Sonnet 4.5 感觉像是在和一个自恋者说话”的社区帖子获得了数千个赞,用户将这种从合作到充满敌意的语气转变称为“The Flip”。Anthropic 在随后的更新中调整了模型,但这一插曲表明,在没有提前警告的情况下,拒绝行为可能会在重大版本发布中大幅恶化。

在窗口填满之前,上下文质量会悄然下降。研究表明,一旦对话达到 200K 上下文窗口的大约 65%,Claude 的输出质量就会明显下降,且应用内没有任何警告。用户报告称,Claude 会重新使用被明确告知不要使用的方法,过度含糊其辞,并失去连贯性。虽然存在上下文压缩(服务器端自动摘要),但质量下降通常发生在这之前。

没有原生的图像生成功能。希望在一个工具中同时获得文本和图像输出的用户必须在其他地方维持单独的订阅。

Claude vs. ChatGPT vs. Google Gemini

ChatGPT (OpenAI) 是最常见的切换对比对象。ChatGPT 包含原生图像生成(DALL-E)和 Claude 无法匹敌的语音模式,并且其 Codex 编码工具在免费和 $20 的 Plus 层级上均可用,这与 Anthropic 在 2026 年 4 月关于 Claude Code 是否会保留在 $20 Pro 计划上的混乱形成了鲜明对比。在写作质量方面,Claude 始终能生成被用户描述为“AI 味更少”、听起来比 ChatGPT 的输出更有意图的文本。在 SWE-bench 上,Claude Opus 4.6 (80.8%) 和 GPT-5.4 (~80%) 实际上处于同一水平,但 Claude 通常需要更少的后续消息就能完成复杂的多步任务而不会偏离主题。ChatGPT 在生态系统广度和语音方面胜出;Claude 在写作和精确的指令遵循方面胜出。

Google Gemini 是上下文窗口方面的竞争对手。Gemini 2.5 Pro 在付费层级提供 1M token 的上下文窗口,是 Claude 200K 标准限制的五倍,而且 Google AI Studio 提供了一个免费的 API 层级,这是 Anthropic 所没有的。对于 Google Workspace 团队来说,Gemini 原生的 Gmail、Docs 和 Drive 集成是 Claude 仅靠 MCP 无法复制的优势。在长会话的指令遵循方面,Hacker News 的开发者一致认为 Claude 比 Gemini 更容易保持在正轨上,而 Gemini 会在会话中途偏离商定的计划。决策建议:当上下文容量超过 200K 或 Workspace 集成是硬性要求时,选择 Gemini;当写作质量和指令遵循更重要时,选择 Claude。

付费层级值得吗?

免费层级的能力超出了大多数用户的想象。截至 2026 年 3 月,Projects、Artifacts、扩展思考、网络搜索和文件上传均可免费使用。真正的限制在于使用频率、极易触及的速率限制,以及缺少 Claude Code。

每月 $20 的 Pro 计划(按年计费为每月 $17)增加了更高的使用限制、Claude Code、模型选择以及 Microsoft 365 和 Google Workspace 集成。对于经常使用 Claude 的开发者来说,这是顺理成章的起点。重要的注意事项:2026 年 4 月 21 日,Anthropic 的定价页面短暂地将 Claude Code 从 Pro 层级中移除,暗示需要每月 $100 的 Max 层级。在公众的强烈反对下,这一改变在几小时内被撤销,但 Anthropic 的增长主管证实,这是一项针对约 2% 新注册用户的活跃测试,这一插曲破坏了人们对定价稳定性的信任,并为竞争对手提供了现成的营销弹药。

每月 $100(5 倍使用量)和每月 $200(20 倍使用量)的 Max 层级专为重度 Claude Code 用户设计。2026 年 3 月的速率限制危机特别打击了 Max 20x 订阅者,有人报告称在一个提示词上使用量就从配额的 21% 飙升至 100%,这使得高级层级的价值主张变得真正难以评估。Opus 4.7 的 API 用户面临着另一个成本问题:新的分词器在相同的每百万输入/输出 $5/$25 的标价下,对相同的输入处理的 token 增加了高达 35%。在公布价格没有任何变化的情况下,实际成本增加了,在迁移之前请重新计算。

最佳用例(以及何时应避开)

在以下情况使用 Claude:你正在撰写专业文章,需要读起来不像是通过模式匹配拼凑而成的输出;你需要一个能够保持多文件上下文、在没有提示的情况下捕捉边缘情况、并遵循规范而不偏离的编码助手;你处理长文档、合同、技术规范、研究 PDF,需要进行无需分块的分析;或者你希望通过自然语言获得实时渲染的交互式输出,而无需接触代码编辑器。

在以下情况避开(或补充使用)Claude:你需要图像生成。Claude 没有原生能力;你正在构建智能体管道并需要可预测的 token 成本。Claude Code 在复杂会话中的消耗率会带来账单上的“惊喜”;你在生产 CI/CD 管道中需要 99.9%+ 的正常运行时间。Claude 在 2026 年第一季度经历了多次中断,包括 4 月 15 日长达 3 小时的宕机;或者你的创意工作涉及角色扮演或安全研究,在这些情况下,拒绝响应很可能会中断工作流。

开始使用 Claude

测试 Claude 核心优势的最快方法:上传一份长文档、合同、技术规范或研究论文,并提出一个需要来自多个章节信息的问题。200K 上下文窗口一次性处理该任务就是最清晰的证明。

对于 Claude Code,从一个真实的、范围明确的任务和清晰的成功标准开始。在进行第一次长智能体会话之前,请关注 token 使用指示器,其消耗率比大多数用户预期的要高。对于 Artifacts,使用自然语言迭代而不是重写:“将图表移到表格下方”、“添加储蓄率字段”。每次修订都会在原地更新 Artifact,无需代码。免费用户无需订阅即可获得 Projects、Artifacts 和扩展思考,在决定 Pro 的速率限制和 Claude Code 是否值得每月 $20 之前,这是一个合理的起点。最后测试时间:2026 年 4 月。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

Claude 的对比表现

与其他工具的并排对比。

收录于精选合集

包含 Claude 的精选合集。

相关文章

与 Claude 相关的指南和文章。