

Gemma 是 Google DeepMind 推出的一系列开放权重语言模型,支持免费下载和自托管。Gemma 4(2026 年 4 月发布)在 Apache 2.0 许可证下提供了前沿级别的推理和多模态能力,涵盖从 2B 边缘模型到 31B 密集型旗舰模型的完整阵容。
Gemma 是 Google DeepMind 推出的一系列开放权重语言模型,于 2024 年 2 月首次发布,目前已迭代至第四代。与封闭的 Gemini API 不同,Gemma 的权重完全支持下载和自托管:无需订阅,没有使用上限,而且自 Gemma 4(2026 年 4 月 2 日发布)起,不再受限于严格的自定义许可证。其名称源自“gemstone(宝石)”,寓意小巧、精密且极具价值。该系列模型介于业余爱好者实验和生产级本地推理之间,专为希望在不依赖云端的情况下获得 Gemini 级别智能的开发者、研究人员和企业而设计。
Gemma 4 提供四种尺寸:Effective 2B(E2B,2.3B 活跃参数)、Effective 4B(E4B,4.5B)、每次前向传递激活 4B 参数的 26B 混合专家(MoE)变体,以及 31B 密集型旗舰模型。所有模型均原生支持图像和视频输入;E2B 和 E4B 还通过 USM conformer 编码器额外支持音频输入,使其成为唯一具备原生音频理解能力的 5B 以下开源模型。大型模型的上下文窗口可达 256K tokens。该系列在设计上原生支持多语言,基于 140 多种语言进行训练,并建立在与 Gemini 3 相同的研究基础之上。Apache 2.0 许可证意味着没有 MAU(月活跃用户)限制,无需署名,且在商业再分发或针对竞争产品进行微调时没有任何障碍。
Gemma 概览(2026 年 4 月)
当前的 Gemma 4 阵容涵盖了完整的部署场景,从端侧移动推理到单 GPU 工作站,再到多 GPU 服务器机架。
Gemma 4 E2B:2.3B 有效参数。上下文:128K。多模态:图像、视频、音频。通过 MediaPipe/LiteRT 面向移动端和边缘设备。在 RTX 3070 上可达到约 60 tok/s。
Gemma 4 E4B:4.5B 有效参数。上下文:128K。与 E2B 相同的多模态技术栈。被推荐为本地桌面推理的“最佳小模型”。
Gemma 4 26B-A4B:混合专家模型(MoE),总参数 26B,每个 token 激活 4B。上下文:256K。在 RTX 4090 Q4 上运行速度约为 11 tok/s。在 LM Arena 上达到 1441 分。以大约少 8 倍的单步推理计算量,达到了 31B 密集型模型 97% 的质量。
Gemma 4 31B Dense:旗舰模型。上下文:256K。基准测试:MMLU Pro 85.2%,AIME 2026 89.2%,GPQA Diamond 84.3%,LiveCodeBench 80.0%。截至 2026 年 4 月,在 LM Arena 开源模型文本排行榜上全球排名第 3。
该架构引入了逐层嵌入(Per-Layer Embeddings, PLE):每个 token 都会接收结合了 token 身份与上下文感知组件的专用逐层向量,而不是单一的前置嵌入,从而实现特定层的专业化。共享 KV 缓存(最后 N 层重用早期层的 K/V 张量)减轻了长上下文推理期间的内存压力。注意力机制在局部滑动窗口(512-1024 tokens)和全局全上下文层之间交替进行,在不牺牲连贯性的情况下减少了长输入的计算量。
前几代模型仍然可用。Gemma 3(2025 年 3 月 12 日发布)的 1B、4B、12B 和 27B 版本仍被广泛用于微调,而 Gemma 2(2B、9B、27B)在 Hugging Face 上依然受支持。所有世代的模型均可通过 Ollama、llama.cpp、MLX(Apple Silicon)和 Hugging Face Transformers 获取。
Gemma 的真正优势所在
根据基准测试和用户测试,Gemma 4 最强的领域是数学推理、代码生成和多模态理解。在 AIME 2026 上,31B 模型的得分为 89.2%,高于同等参数级别的 Llama 4 Scout 或 Qwen 3.5。在 Codeforces 上,它达到了 ELO 2150,在 27-31B 级别中处于领先地位。26B MoE 生成的代码被用户描述为在质量上与付费 API 模型无法区分,而运行成本仅为其一小部分。
“这种优秀程度会让你重新检查请求,看看自己是不是不小心把它路由到了 Claude Sonnet。” - PIXIPACE,Medium,2026 年 4 月
其多模态能力是真实且具有差异化的。所有 Gemma 4 模型都能处理具有可配置 token 预算(70 到 1120 个视觉 tokens)的可变分辨率图像,支持用于目标检测的原生边界框输出、从屏幕截图重建 HTML 以及图表分析。E2B 和 E4B 上的音频功能在 5B 以下级别中是独一无二的。对于构建同时处理语音输入和图像的端侧流水线的团队来说,目前在同等规模下没有具备相同覆盖范围的竞争性开放权重模型。
“我印象深刻,极其智能的模型,具备前沿级别的智能,又不像 70B+ 模型那样占用大量资源……这拉平了竞争环境,让每个拥有中等配置系统的人都能接触到 AI。” - DorkMckork1,Hugging Face,2026 年 4 月
Gemma 4 带来的 Apache 2.0 许可证变更具有实际意义:大公司的法务团队通常已预先批准了 Apache 2.0。之前的 Gemma 使用条款虽然在精神上是合理的,但存在模糊的例外条款,让采购部门感到不安。现在,这种摩擦已经不复存在。
Gemma 的局限:用户经常遇到的故障模式
最持久的抱怨是长上下文时的 KV 缓存内存压力。在 24GB VRAM 上以 40K+ tokens 运行 26B 或 31B 模型的用户报告称,随着缓存的增长,会出现内存不足崩溃和质量下降的情况。共享 KV 缓存架构在理论上是高效的,但当大型量化模型填满可用内存时,它就显得毫不留情。一种解决方法(将 KV 缓存量化为 Q4)有所帮助,但增加了配置开销。
MoE 路由开销在实际应用中令人意外。尽管每次前向传递仅激活 4B 参数,但 26B-A4B MoE 在 RTX 4090 Q4 上的运行速度约为 11 tokens/sec,慢于 Qwen 3.5 同等模型约 35 tok/s 的速度。期望从 26B MoE 获得“4B 速度”的用户往往会感到失望。对于对延迟敏感的应用程序,31B 密集型模型或更小的模型是更好的选择。
发布时推理生态系统的脆弱性是 Gemma 反复出现的模式。Gemma 4 于 2026 年 4 月 2 日发布时伴随着以下问题:在 llama.cpp 中启用 -nkvo 后,大约 230 个 tokens 后输出乱码(GitHub issue #21726);Ollama v0.20.0 中的工具调用损坏;在 Apple Silicon 上超过 500 个 tokens 的提示词会导致 Flash Attention 挂起;以及在未打补丁的容器上崩溃并提示“unknown model architecture: 'gemma4'”。随着修复程序的落地,该模型不得不重新上传到 Hugging Face 四次。社区达成了一个明确的共识:在通过不稳定的推理栈评判新版 Gemma 的质量之前,至少要等待一周。
密集文本的视觉 OCR 表现不一致。Hugging Face 上关于 Gemma 4 31B-it 模型的一个讨论帖指出,该模型无法可靠地“识别图像上的全部文本”。图表分析能力强于文档 OCR。Gemma 3 的基本事实回忆精度被记录为较弱(SimpleQA 得分为 10.0);Gemma 4 有了大幅改进,但在没有检索增强生成(RAG)的情况下,该系列并不擅长死记硬背式的查找查询。
发布首周 Hugging Face 上的一条批评意见反映了真实的挫败感:
“在我看来,这次发布有些令人失望……我只希望大型科技公司能借鉴 OpenAI 的做法,发布真正具有竞争力的开源软件,而不是推出平庸的模型……” - urroxyz,Hugging Face,2026 年 4 月
这种批评有些言过其实。基准测试的结果并不平庸。但这反映了本地 AI 社区中一部分人的看法,他们认为 Gemma 在特定的智能体和工具调用工作流方面,没有达到他们所期望的差异化水平。
Gemma vs. Llama 4 vs. Qwen 3.5
Llama 4(Meta)在不同规模上使用了纯 MoE 架构:Scout 总参数为 109B,每个 token 激活 17B;Maverick 总参数为 400B,激活 17B。Scout 的 10M token 上下文窗口是其核心差异化优势(Gemma 4 最高为 256K)。然而,Llama 4 的自定义社区许可证施加了 700M MAU 的上限,要求使用“Built with Llama”品牌标识,并禁止使用 Llama 的输出训练竞争模型。对于发布商业产品的企业团队来说,该许可证需要专门的法务审查。Gemma 4 的 Apache 2.0 则没有这些条件。在基准测试中,Gemma 4 31B 在 GPQA Diamond(84.3% 对 74.3%)、AIME 2026 和编码方面领先于 Llama 4 Scout。Llama 4 没有原生音频支持;而 Gemma 的 E2B/E4B 则具备。对于超过 256K 的原始上下文需求,Llama 4 Scout 是开放权重层级中的唯一选择。
Qwen 3.5(Alibaba)同样采用 Apache 2.0 许可证,并提供最广泛的模型范围(0.8B 到 397B MoE),其中 35B-A3B 每个 token 仅激活 3B 参数,是该层级中最激进的稀疏率。在同等硬件上,Qwen 3.5 的运行速度大约是 Gemma 4 31B 密集型模型的 3 倍(在 RTX 4090 Q4 上为 35 tok/s 对 25 tok/s)。MMLU Pro 略微倾向于 Qwen(86.1% 对 85.2%)。Gemma 的主要优势在于:小模型上的音频输入、实现更好长上下文连贯性的逐层嵌入架构、更紧密的 Gemini 生态系统集成(AI Studio、Vertex AI),以及更广泛的部署目标(包括用于端侧的 MediaPipe/LiteRT)。两者都非常强大;实际选择通常取决于您是需要音频输入还是更快的 MoE 吞吐量。
2025 年 3 月 12 日 Gemma 3 的发布是一个转折点。27B 模型在各项基准测试中击败了闭源的 Gemini 1.5 Pro,而 4B 模型则击败了 Gemma 2 的整个 27B 模型。LMSys 将 Gemma 3 27B 列入全球前 10 名。这确立了该系列模型的信誉,并为 Gemma 4 更激进的定位奠定了基础。
付费层级值得吗?
Gemma 没有付费订阅。其权重在 Apache 2.0 下是免费的。成本问题纯粹是关于基础设施的选择。除了硬件之外,自托管是免费的(26B MoE 在 Q4 量化下适合 16GB VRAM;31B 需要 24GB)。Google AI Studio 提供免费但有速率限制的 API 访问。OpenRouter 在其免费层级上以 $0/M tokens 路由 31B 模型,在标准层级上输入/输出每百万 tokens 为 $0.13/$0.38。Vertex AI 运行 26B MoE 的价格为每百万 tokens $0.15/$0.60,是需要托管 SLA 和 GCP 计费整合的团队的正确选择。对于大多数开发者来说,Google AI Studio 或自托管可以满足一切需求,直到生产规模需要托管基础设施为止。
最佳用例(以及何时应避免使用)
最适合:
在消费级硬件上进行本地推理,无需云 API 成本。4B 或 26B MoE 涵盖了大多数编码和助手任务。
需要多模态输入(图像、音频、视频)且不依赖云端的端侧移动和边缘应用。只有 Gemma 提供具备原生音频输入的 5B 以下模型。
针对特定领域的微调。Unsloth 和 TRL 集成支持带有 CARLA 风格智能体示例的多模态微调。一位 Hugging Face 评论者指出它“完全符合我们的儿童教育领域”,并立即将其投入生产。
需要宽松、法务预先批准的许可证(Apache 2.0),并希望获得 Google 级别智能而无需承担 Google 云端定价的企业团队。
跨 140 多种语言的多语言助手应用,在这些应用中,特定语言分词的训练数据质量至关重要。
何时应避免使用:
您需要超过 256K tokens 的上下文。Llama 4 Scout 可处理高达 10M。
原始推理速度是首要任务。Qwen 3.5 在同等硬件上运行速度更快,并提供更小的起始模型尺寸(0.8B)。
您需要在 Gemma 重大发布的第一周内进行部署,并且无法容忍推理生态系统的不稳定。发布首周出现错误的模式在各代产品中是一致的。
您的用例主要是密集文本的文档 OCR。其视觉能力在图表和 GUI 理解方面强于文本密集的页面识别。
开始使用 Gemma
最快的本地路径是 Ollama:ollama run gemma4 会自动拉取默认尺寸。对于 Apple Silicon,MLX 在吞吐量方面优于 Ollama。如需量化控制,请使用 llama.cpp 搭配来自 Hugging Face 的 ggml-org GGUF 构建版本。Google AI Studio (ai.google.dev) 提供免费的 API 访问,无需任何基础设施。OpenRouter 在其免费层级上以零成本路由到 31B 模型。微调由 Unsloth Studio、TRL 和 Vertex AI 托管容器提供支持。该模型的原生函数调用 tokens 可直接与 JSON 模式或带类型的 Python 函数配合使用。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Gemma 的精选合集。
相关文章
与 Gemma 相关的指南和文章。

Gemma 4 on RTX 4090: Real Tokens/Sec, VRAM & Variant Pick (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Run Open Source AI Models Locally: Battle-Tested Guide

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration
