
Zhipu GLM 是由总部位于北京的 Z.ai(Zhipu AI)推出的一系列开源权重的大型语言模型,基于混合专家(MoE)架构构建。GLM-4.5 和 GLM-4.6 代模型采用 MIT 许可证,支持自托管,提供 200K Token 上下文、免费的 API Flash 层级,并在基准测试中展现出与 Claude 和 DeepSeek 媲美的实力。
Zhipu GLM 是由 Z.ai 构建的一系列开源权重的大型语言模型。Z.ai 是总部位于北京的 Zhipu AI 的国际品牌,该公司于 2019 年从清华大学孵化成立。GLM 系列采用混合专家(MoE)架构,并在 MIT 许可证下发布权重,这意味着开发者可以自托管、微调并在商业上部署这些模型,而无需承担版税义务或受到使用限制。其 Web 界面位于 chat.z.ai;API 访问则通过 bigmodel.cn 和 docs.z.ai 进行。截至 2026 年中,活跃的迭代版本包括 GLM-4.5(2025 年 8 月发布)、GLM-4.6(2025 年 9 月发布)和 GLM-4.7(2025 年 12 月发布),每一个版本都在编程、推理和智能体能力上实现了渐进但显著的飞跃。
其核心功能非常直观:200K Token 的上下文窗口(从 GLM-4.6 开始)、用于在深度与速度之间权衡的双重思考/非思考模式、通过 GLM-V 变体提供的多模态视觉支持,以及与兼容 OpenAI 的 API 客户端的完全兼容性,使其成为 Cline、Roo Code 和 OpenCode 等工具中的理想平替。免费的 Flash 变体(GLM-4.7-Flash、GLM-4.5-Flash)可通过 API 免费用于轻量级任务。完整版 GLM-4.5 的付费 API 访问价格为输入 $0.60/百万 Token,输出 $2.20/百万 Token,在同等能力层级下比 Claude Sonnet 便宜约 5-6 倍。开源权重托管在 HuggingFace(zai-org/GLM-4.5、zai-org/GLM-4.6)和 ModelScope 上,并内置了对 vLLM 和 SGLang 推理的支持。
Zhipu GLM 概览(2026 年 5 月)
GLM 系列涵盖了多个活跃的模型变体。GLM-4.5 总参数量为 3550 亿,激活参数为 320 亿(MoE 路由),具备 128K Token 上下文,并采用 MIT 许可证以支持商业部署。GLM-4.5-Air 将其精简为 1060 亿总参数和 120 亿激活参数,在保留大部分基准测试质量的同时,显著降低了硬件要求。GLM-4.6 将上下文扩展至 200K Token,Token 效率比 GLM-4.5 提高了约 15%,并在 2025 年 9 月发布时在 LMArena 的开源模型中拔得头筹。2025 年 12 月 22 日发布的 GLM-4.7 引入了“谋定而后动(thinking before acting)”的行为模式,这种行动前的推理停顿使其在 Humanity's Last Exam (HLE) 基准测试中的表现比 GLM-4.6 提升了 38%。多模态的 GLM-4.6V(106B)及其较小的 GLM-4.6V-Flash(9B,可免费商用)为该系列增加了图像理解能力。所有模型均原生支持中英文,这反映了 Z.ai 的主要市场定位,也是该系列在双语企业部署中真正的竞争优势之一。
Zhipu GLM 的真正优势
基准测试数据是最客观的起点。GLM-4.5 在 AIME 2025 数学竞赛题中得分 98.2%,在该任务上与 Claude Opus 4 旗鼓相当。在工具调用基准测试中,它超越了 Claude Sonnet 4(90.6% 对 89.5%)。在网页浏览智能体任务上,GLM-4.5 优于 Claude 4 Opus(26.4% 对 18.8%)。到了 GLM-4.6,其在 LiveCodeBench 上的编程表现达到了 82.8%,逼近 Claude 4 80% 中段的水平。GLM-4.6 在 AIME 2025 上得分 93.9%,在 GPQA 上得分 82.9%,在后者上基本与 Claude 4.5 打成平手。
对于开发者而言,MIT 许可证是改变游戏规则的特性。通过 Ollama 或 vLLM 自托管 GLM-4.5 意味着没有按 Token 计费的成本,无需接受使用政策审查,并且能够在专有代码库上进行微调。200K Token 的上下文可以在单次请求中处理庞大的遗留代码库。其前端生成能力备受赞誉:评测者称 GLM-4.6 能够生成“视觉上非常精美的前端页面”,且几乎不需要后续清理。对于智能体工作流,该模型通过兼容 OpenAI 的端点,能够与 Cline、Roo Code 以及兼容 MCP 的设置进行无缝集成。
“自从本月 GLM-4.6 发布以来,我一直在使用它。它成了我的新宠。在使用这两项服务两年后,我取消了 Claude 的订阅。” —— jhancock,Hacker News,2025 年 9 月
“在对基于 GLib/GObject 构建的复杂但常见的开源库进行故障排除时,GLM 4.7 已经处于领先地位。” —— greenavocado,Hacker News,2026 年 3 月
中英双语任务是其显著优势。对于需要同时处理中文法律文件、财务报告或客户数据并输出英文的团队来说,GLM 的原生中文优化比主要在英文语料库上训练的模型更可靠。
Zhipu GLM 的局限性与常见故障模式
报告最多的摩擦点是中文查询中的政治内容过滤。发表在 PNAS Nexus (2026) 上的研究证实,当使用中文提示时,GLM 模型会拒绝讨论天安门广场、香港抗议活动和对中共的批评,而用英文提出同样的问题可能会得到实质性的回答。这种依赖于语言的审查是中国政府 AI 监管的产物(公司在公开发布前必须证明对特定话题的拒绝能力),而非技术限制。社区已经在 Hugging Face 和 Ollama 上创建了消除限制(abliterated)和解除限制(derestricted)的 GGUF 变体,但需要不受政治约束的中文回复的用户应谨慎评估替代方案。
SWE-Bench Verified 的表现显示了在前沿领域的实际差距:GLM-4.6 的得分为 68%,而 Claude Sonnet 4.5 为 77.2%。对于在庞大且陌生的代码库中进行复杂的存储库级别调试,Claude 依然保持着显著的优势。GLM-4.7 对此进行了改进,但在 GUI/浏览器控制任务和长时间的自主编程会话上,差距依然存在。
免费层的速率限制令人头疼。Flash API 模型对注册用户有速率上限,而免费的 chat.z.ai 界面有每周使用限制,这让那些发现该模型并试图在决定付费前进行高强度测试的高级用户感到沮丧。每月 $3 的 Coding Plan 促销定价于 2026 年 2 月 11 日取消,并在 2026 年初提价约 30%,这在早期采用者中引发了一些不满。
生态系统深度不如 OpenAI 或 Anthropic。没有原生的浏览器扩展,没有移动应用,插件/集成目录也很稀少。开发者通过第三方工具中兼容 OpenAI 的端点来使用它,虽然运行可靠,但开箱即用的消费者体验相对滞后。
Zhipu GLM vs. Qwen vs. DeepSeek
Qwen(阿里巴巴)和 GLM 是最强大的两个中国开源权重模型系列,它们的架构差异对部署决策至关重要。Qwen 3.6-35B-A3B 仅使用 30 亿激活参数,而 GLM-4.5 为 320 亿激活参数,这使得 Qwen 在同等质量层级下的单次推理运行成本大幅降低。Qwen 3.6 Plus 将上下文扩展至 1M Token,而 GLM-4.6 为 200K,这对于超长文档任务来说是一个显著的差距。在 GLM-4.5 发布时的直接编程评估中,GLM 在与 Qwen3-Coder 的正面交锋任务中取得了 80.8% 的胜率,但 Qwen 在 SWE-Bench Verified 的每 FLOP 效率上处于领先地位。对于 GPU 预算较紧的团队来说,Qwen 通常是更精简的选择;而在每一代的原始基准测试质量上,GLM 和 Qwen 则根据任务类型互有胜负。
DeepSeek V3/V4 在同一前沿层级竞争,但模型规模要大得多:总参数量约为 1 万亿,需要 H100 或 H800 GPU 集群才能进行全规模自托管。拥有 320 亿激活参数的 GLM-4.5 在较小的硬件上更容易部署,使得没有超大规模 GPU 访问权限的团队也能实现自托管。在 API 定价方面,DeepSeek 更便宜(输入 $0.28/M 对比 GLM-4.5 的 $0.60/M),并且 DeepSeek V4 以 83.7% 的 SWE-Bench Verified 成绩在原始编程基准测试中领先。DeepSeek 还在 2025 年 1 月遭遇了一次备受瞩目的数据泄露事件,暴露了用户的聊天记录,而 GLM 尚未发生过类似事件。这两种模型都表现出依赖于语言的政治内容过滤,尽管具体情况因话题和部署环境而异。对于成本主导的纯 API 使用场景,DeepSeek 在价格上胜出。而对于在中端硬件上的自托管部署,GLM 较小的激活参数占用则是其实际优势。
与 Llama(Meta)和 Mistral 相比,GLM 的主要区别在于大规模的中英双语训练以及前沿参数层级的 200K Token 上下文。Llama 4 的 Scout/Maverick 变体使用的是密集 Transformer 架构而非 MoE,这导致了不同的硬件权衡。Mistral 的开源模型在欧洲多语言用例中依然强劲,但在中文表现上不及 GLM。与另一个中国开源权重竞争对手 Kimi(Moonshot AI)相比,GLM-4.6 和 Kimi K2 在编程性能上大致相当,Kimi 提供了略大的 256K 上下文(对比 GLM-4.6 的 200K),而 GLM 则表现出更好的 Token 效率。
付费层级值得吗?
对于大多数个人开发者来说,免费层是一个真正的起点,而不仅仅是试用。GLM-4.7-Flash 和 GLM-4.5-Flash 可通过 API 零成本使用,能够免费处理各种格式化、摘要和轻量级编程任务。免费的 chat.z.ai Web 界面提供了对全质量模型的访问,但有每周上限。
Coding Plan 订阅(Lite 约 $10/月,Pro 约 $30/月,Max 约 $80/月)对于将 GLM-4.6 或 GLM-4.7 作为主要编程助手的团队来说是合理的,因为按 Token 计算的 API 成本会超过订阅门槛。对于 API 密集型的生产工作负载,按需付费(输入 $0.60/M Token)与同等的闭源替代方案相比具有成本效益。在输出 $2.20/M Token 对比 Claude Sonnet 3.5 约 $15/M 输出的情况下,即使按付费费率计算,GLM 在高容量生成任务中也更具性价比。
开源权重是其隐藏的价值所在。在租赁的 GPU 集群上通过 vLLM 自托管 GLM-4.5 可以完全消除按 Token 计费的成本。对于具有可预测、高容量推理负载的团队来说,MIT 许可证意味着在 6-12 个月内,总拥有成本甚至可以降至比最便宜的托管 API 选项还要低。
最佳用例(以及何时应避开)
GLM 最适合:构建自托管智能体管道的开发者,他们需要采用 MIT 许可证的权重以便在专有代码上进行微调;大规模处理文档的中英双语企业团队;从事繁重数学和逻辑任务(AIME 级别竞赛题)的研究人员;以及运行高容量 API 工作负载且对成本敏感、认为 Claude 定价过高的团队。
在以下情况应避开 GLM:您的用户主要使用中文写作并需要讨论政治敏感话题(内容过滤是监管要求,无法通过官方 API 进行配置);您的工作流依赖于 GUI/浏览器自动化,而 Claude Sonnet 4.5 依然是该领域的基准领导者;您需要一个带有移动应用和浏览器扩展的精美消费者产品;或者您的团队不惜一切代价需要前沿级别的 SWE-Bench Verified 性能(Claude Sonnet 4.5 以 77.2% 依然领先于 GLM-4.6 的 68%)。
开始使用 Zhipu GLM
最快的途径是 chat.z.ai,只需免费注册即可立即访问全质量模型,但有每周使用上限。如需 API 访问,请在 bigmodel.cn 或 docs.z.ai 注册,它会发放与 OpenAI 格式客户端兼容的 API 密钥。要将 Cline 或 Roo Code 指向 GLM-4.6,只需将基础 URL 设置为 Z.ai 端点并填入 API 密钥,除此之外无需更改任何配置。
对于本地部署,GLM-4.6 权重位于 HuggingFace 的 zai-org/GLM-4.6,并在 Ollama 上提供 GGUF 量化版本(ollama pull glm-4.6)。32B 激活参数的 MoE 模型在全精度下可在具有 40-80GB VRAM 的机器上运行;4 位量化版本降至 20-24GB,使其在双消费级 GPU 设置上切实可行。vLLM 和 SGLang 是生产环境自托管支持的推理框架。对于硬件预算较紧但仍希望使用开源权重模型而非 Flash API 层的团队,推荐从 GLM-4.5-Air 变体(12B 激活参数)开始。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Zhipu GLM 的精选合集。
相关文章
与 Zhipu GLM 相关的指南和文章。

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Local Agentic Coding May 2026: Qwen 3.6 + BeeLlama.cpp + Star Elastic
