
Llama 是 Meta 旗下的开放权重语言模型系列,从 2023 年的初代版本发展至 Llama 4 的多模态 MoE 版本。该系列模型可免费下载并支持自托管,为全球数以千计的衍生工具和企业级工作流提供强大动力。
Llama 是由 Meta Platforms 构建并发布的开放权重(open-weight)大型语言模型系列。该系列于 2023 年 2 月首次发布,历经四代重大迭代,已成为 AI 历史上被复刻(fork)最多的模型谱系,在 Hugging Face 上驱动了超过 20,000 个衍生模型。与闭源模型提供商不同,Meta 开放了实际的模型权重供用户下载:研究人员、开发者和企业可以在自有硬件上本地运行 Llama,在私有数据集上进行微调,并重新分发修改后的版本,而无需支付按 Token 计费的 API 费用。
当前的旗舰代 Llama 4(于 2025 年 4 月 5 日发布)从密集型 Transformer 架构转向了稀疏的混合专家(MoE)架构,并新增了原生多模态功能。Llama 4 Scout 在 16 个专家中拥有 1090 亿总参数,其中 170 亿为激活参数,官方宣称具备 1000 万 Token 的上下文窗口,且能够部署在单张服务器级 GPU 上。Llama 4 Maverick 则扩展至 128 个专家、4000 亿总参数,推理时激活 170 亿参数,并具备 100 万 Token 的上下文窗口。这两款模型均通过早期融合(early fusion)技术同时处理文本和图像。自托管访问是免费的;Together AI、Fireworks 和 Groq 等第三方提供商通过 API 提供模型服务,Scout 的起步费率约为每百万输入 Token $0.08。
Llama 概览(2025 年 4 月)
2025 年 4 月 5 日发布的 Llama 4 将该系列从密集型 Transformer 转向了稀疏的混合专家(MoE)架构,即每个 Token 仅激活专门的“专家”子网络的一个子集,而非整个参数集。目前有两款模型公开发布:
Llama 4 Scout (17B/109B):170 亿激活参数,1090 亿总参数,16 个专家,1000 万 Token 上下文(指令微调版)。量化后可部署在单张 H100 GPU 上。在涵盖 200 种语言的高达 40 万亿 Token 上进行了训练。
Llama 4 Maverick (17B/400B):170 亿激活参数,4000 亿总参数,128 个专家,100 万 Token 上下文(指令微调版)。提供 BF16 和 FP8 格式。全精度下需要多 GPU 或分布式服务。
Llama 4 Behemoth(约 2 万亿总参数):于 2025 年 4 月宣布,但截至 2026 年 4 月尚未公开发布。定位为 Meta 的前沿研究模型,拥有约 2880 亿激活参数,并具备原生视频理解能力。
早期的 Llama 3.x 世代仍被广泛部署。Llama 3.3 70B 和 Llama 3.1 8B 依然是许多开发者在代码工作流中的首选,部分原因是其密集型架构在服务行为上比 Llama 4 的 MoE 结构更具可预测性。
Llama 的核心价值
对于有严格数据隐私要求的团队而言,Llama 的价值非常直接:您的数据永远不会离开您的基础设施。法律取证平台、处理患者记录的医院、分析敏感文档的国防承包商,以及负有数据处理合规义务的金融机构,都正是出于这个原因部署了 Llama。只需下载一次权重,推理过程完全在您自己的环境中运行。
Llama 吸引的庞大生态系统是其第二大优势。Ollama、llama.cpp、vLLM 和 Text Generation Inference (TGI) 均原生支持 Llama。AWS Bedrock、Google Vertex AI 和 Azure 都提供托管的 Llama 端点。Hugging Face 托管了模型权重,并提供原生的 Transformers 集成。无论开发者是需要在本地运行模型、在领域数据上进行微调,还是连接到推理后端,每一步都有成熟的教程和经过生产环境验证的工具。
微调是第三大支柱。通过 Hugging Face PEFT 使用 LoRA 和 QLoRA,团队可以将 Llama 适配到狭窄的垂直领域:合同分析、临床记录摘要、合规性审查等。这是闭源模型供应商所不允许的。
“Ollama + Llama 3.1 8B。如果在实际使用一周后它仍不能满足你的需求,那么你对差距的理解就足以让你做出更好的选择了。” —— r/LocalLLaMA 社区讨论帖,2025 年
Llama 的局限性 —— 用户频频遇到的失效模式
Llama 4 世代在开发者社区中遭遇了强烈的负面反馈,这些问题值得客观报道。
长上下文在规模化时的性能衰减。Llama 4 Scout 宣称的 1000 万 Token 上下文在实际应用中超过 256K Token 后便无法维持。这些模型在预训练时的序列长度最高为 256K Token;1000 万的数字适用于扩展了位置编码的指令微调版本,但并不能保证在全长下的推理质量。独立基准测试发现,在扩展长度下的复杂检索任务中,准确率骤降至 15.6%。在相同的测试中,Gemini 在同等长度下保持了 90%+ 的性能。vLLM 流水线并行模式中的实现级 Bug 导致 Llama 4 在 64K+ Token 时输出乱码,这在多个 GitHub Issue 中均有记录。
“Llama Scout 和 Llama Maverick 看起来令人深感失望 —— 这种失望程度甚至让人觉得‘大家以为一定是配置错了才会这么糟糕’。” —— Hacker News 讨论帖,2025 年 4 月
代码性能低于预期。Llama 4 Maverick 在 Aider Polyglot 编程基准测试中得分仅为 16%,尽管其激活参数量是 Qwen 2.5 Coder 的 10 倍,但表现依然落后。在针对 SRE 的编程基准测试中,它以 69.5% 的准确率垫底,比 DeepSeek V3 低 6%,比 GPT-4o 落后 18%。开发者指出,上一代的 Llama 3.3 70B 在某些编程任务上的表现甚至优于 Llama 4 Maverick。以代码为主导工作流的团队几乎找不到升级的理由。
Llama 4 缺乏小型消费级模型。Llama 3.2 世代包含了可在消费级硬件和移动设备上运行的 1B 和 3B 模型。而 Llama 4 首发仅有 Scout(1090 亿总参数)和 Maverick(4000 亿总参数)。公开发布的最小 Llama 4 模型也需要服务器级硬件,这实际上将推动 Llama 3 广泛普及的业余爱好者和 MacBook 开发者群体拒之门外。这是一个结构性断层,而非配置问题。
输出质量被指平庸。多份开发者分析指出,与竞争对手相比,Llama 4 的输出显得冗长且缺乏特色。一个普遍的观察是:模型倾向于生成冗长、充斥表情符号的回复,而不是精确、直接的答案。对于需要严格遵循指令的生产用例,一些团队发现 Llama 3.1 模型更具可预测性。
Llama vs. Mistral vs. Qwen
这三者均为开放权重模型系列。它们之间的差异主要体现在架构、许可协议和基准测试水平上。
Mistral(Mistral AI,法国):Mistral Small 4(2026 年 3 月)采用 MoE 架构,总参数量为 1190 亿,但每个 Token 仅激活 4 个专家,每次推理约产生 60 亿激活参数 —— 不到 Llama 4 Scout 170 亿激活参数的一半。较小的激活规模意味着在同等硬件下,每个 Token 的推理成本更低。其采用 Apache 2.0 许可证:完全宽泛,没有 MAU(月活跃用户)上限,没有下游限制,也无需署名。Mistral 的上下文窗口为 256K(小于 Scout 的宣称值,但更接近硬件实际能可靠交付的水平)。Mistral 没有同等规模的社区衍生模型,但其更纯粹的开源协议使其成为那些担忧 Llama 700M MAU 条款的初创公司的默认选择。
Qwen(Alibaba,中国):Qwen 3.5/3.6 同样采用 MoE 架构,总参数量约为 3970 亿,激活参数为 170 亿,在激活算力上与 Llama 4 Scout 直接对标。采用无限制的 Apache 2.0 许可证。截至 2025-2026 年,Qwen 在代码基准测试中处于领先地位:Qwen 2.5-Coder-32B 登顶代码排行榜,Qwen 3.6 Plus 在 SWE-bench 上得分 78.8%,而 Llama 4 Maverick 约为 70%。到 2026 年初,Qwen 在 Hugging Face 的总下载量超过了 Llama,累计下载量近 10 亿次。截至 2026 年 2 月,Qwen 在 Hugging Face 上的衍生模型份额达到 69%,而 Llama 为 11%。对 Qwen 的主要担忧在于它由 Alibaba 开发,这给一些企业买家带来了数据溯源和地缘政治合规性方面的问题,而 Llama 则不存在这些问题。
总结:在相似的总规模下,Llama 4 的激活参数量超过了 Mistral,且生态系统比这两个竞争对手都要庞大。但 Mistral 和 Qwen 都使用没有商业限制的 Apache 2.0 协议,并且在同等激活算力下,Qwen 在代码能力上处于领先地位。
许可证陷阱 —— 700M MAU 究竟意味着什么
Meta 的 Llama 4 社区许可协议授予了在商业产品中免费使用、修改和分发权重的权利,但有一个硬性限制:如果您的产品或服务的月活跃用户超过 7 亿(700M MAU),您的许可证将自动终止,您必须联系 Meta 协商单独的协议。Meta 没有义务授予该协议,可以附加任何条款,也可以在不作解释的情况下予以拒绝。
这个门槛听起来极高,但需要注意的是,它适用于整个产品,而不仅仅是特定的 AI 功能。一家拥有 8 亿用户的公司如果想在其平台的某个角落添加一个由 Llama 驱动的客服聊天机器人,在技术上就已经超出了许可范围。该条款还跨关联公司进行汇总:计算的是整个企业集团的总用户数,而不仅仅是单个子公司的用户数。
法律分析人士指出,700M MAU 的限制与 OSI(开源促进会)正式的开源定义是不兼容的:尽管 Meta 在营销中使用了“开源”一词,但将 Llama 描述为“源码可见(source available)”更为准确。对于要求生产系统中的软件必须使用 OSI 批准许可证的采购团队来说,这一点至关重要。
相比之下,Mistral 和 Qwen 采用 Apache 2.0 协议发布。没有用户上限,没有署名要求,也无需进行任何谈判。
最佳用例与何时应避开 Llama
Llama 的优势场景:
企业数据隐私工作流:法律、医疗、金融和国防团队在内部文档上部署 RAG,且数据主权不容妥协的场景。开放权重意味着推理完全在您的基础设施内运行。
针对垂直领域的微调:需要模型理解专有术语、特定监管语言或领域特定推理的团队。Llama 上的 LoRA/QLoRA 微调拥有完善的文档,并得到整个 Hugging Face 工具链的支持。
对单 Token 成本要求较低的高并发应用:在自有 GPU 集群上自托管 Llama 的规模化成本远低于支付专有 API 的费用。对于每月生成数亿 Token 的应用,开放权重在经济上更具优势。
研究与实验:需要白盒访问模型权重以探测内部表示的可解释性研究人员、对齐团队和红队人员。
何时应避开 Llama:
您的主要需求是代码辅助:在同等激活参数量下,Qwen 2.5-Coder 和 DeepSeek Coder 在代码基准测试中优于 Llama 4。如果代码是主要用例,选择显而易见。
您需要可靠的 100 万+ Token 上下文窗口:Scout 宣称的 1000 万和 Maverick 宣称的 100 万上下文在超过 256K Token 的实际检索基准测试中无法维持。对于超长上下文下真正的“大海捞针”任务,Gemini 1.5/2.5 才是正确的工具。
您希望获得无需工程开发的聊天界面:Llama 提供的是权重,而不是应用程序。要获得可用的聊天界面,需要使用 Ollama、llama.cpp 或第三方托管端点。非技术用户应直接使用 Claude、Gemini 或 ChatGPT。
您的公司拥有或预计拥有 7 亿+ MAU:超过此门槛,其许可结构要求与 Meta 进行谈判。对于大型平台而言,采用 Apache 2.0 协议的 Mistral 或 Qwen 在结构上更为简单。
开始使用 Llama
最快的本地部署途径是 Ollama:安装后,运行 ollama pull llama3.2 即可在消费级硬件上获取 3B 模型,并通过 ollama run llama3.2 或本地 API localhost:11434 进行访问。Llama 4 Scout 需要服务器级 GPU;通过 llama.cpp 的量化版本可在高显存的消费级机器上运行。对于无需自托管的云 API 访问,Together AI 和 Fireworks 提供的 Scout 价格约为 $0.08/M Token,Maverick 约为 $0.15-$0.30/M Token。Hugging Face 在 meta-llama 组织下托管了模型权重;Transformers v4.51.0+ 原生支持 Llama 4,包括多模态输入。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 Llama 的精选合集。
相关文章
与 Llama 相关的指南和文章。

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Run Open Source AI Models Locally: Battle-Tested Guide

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives
