

OLMo 是 AI2 推出的完全开源的语言模型系列,不仅在 Apache 2.0 许可下发布了权重,还发布了完整的 Dolma 训练数据集、所有训练代码以及中间检查点。它是研究社区进行可复现、可审计的 LLM 科学研究的首选。
OLMo 是由总部位于西雅图的非营利研究机构 Allen Institute for AI (AI2) 构建的开源语言模型系列。大多数“开源” LLM 只是提供权重就万事大吉了,而 OLMo 则走得更远:每次发布都包含完整的 Dolma 预训练数据集、训练代码、评估套件、优化器状态以及训练各个阶段的中间检查点。所有组件均在 Apache 2.0 许可下发布,这意味着没有使用限制,没有商业门槛,模型学到了什么以及从哪里学到的也不再是秘密。该系列涵盖 OLMo 1B、7B、13B 和 32B 密集模型,以及 OLMoE(一种稀疏混合专家变体,总参数量为 70 亿,每次激活 10 亿参数)。后训练阶段使用 Tulu 管道,赋予了 Instruct 变体极具竞争力的指令遵循和 RLHF 对齐能力。
当前一代 OLMo 2 于 2024 年 11 月推出,其 7B 和 13B 模型在学术基准测试中击败了 Llama 3.1 8B。2025 年 3 月发布的 OLMo 2 32B 成为首个在一系列多技能评估中击败 GPT-3.5 Turbo 和 GPT-4o mini 的完全开源模型。AI2 还于 2025 年 4 月发布了 OLMoTrace,该工具利用跨越 4.6 万亿个 token 的 infini-gram 索引,可将任何模型输出追溯到可能对其产生贡献的特定训练文档。这种级别的可追溯性在 LLM 领域是独一无二的,这使得 OLMo 成为 AI 安全审计员、偏见研究人员以及任何需要回答“模型从哪里学到这个?”的人的事实上的研究平台。
OLMo 概览(2026 年 4 月)
OLMo 系列涵盖三条产品线。基础密集模型(7B、13B、32B)采用带有旋转位置编码的 Transformer 架构,并在 Dolma 语料库上进行训练,这是一个多源数据集,提取自网络文本、代码、书籍、科学论文和百科内容。OLMo 2 模型分两个阶段进行训练:第一阶段在 OLMo-Mix-1124(约 3.9 万亿个 token,来自 DCLM、Dolma、Starcoder 和 Proof Pile II)上进行,第二阶段在 Dolmino-Mix-1124(8430 亿个 token,包含精选的高质量网络和特定领域内容)上进行。OLMoE 是稀疏 MoE 变体:总参数量为 70 亿,每次前向传播激活 10 亿参数,在 5 万亿个 token 上进行训练,且每计算单元的训练速度大约是同等密集模型的 2 倍。Tulu 后训练管道(SFT、DPO、PPO)为每个尺寸生成了 -Instruct 变体。OLMo 2 7B 和 13B 的上下文窗口为 4,096 个 token,在后续版本中得到了扩展。所有模型均以英语为目标语言;多语言支持仍然有限。模型托管在 allenai 的 Hugging Face 组织下,并通过 HuggingFace Transformers、vLLM 和 Ollama 原生加载。
OLMo 的真正优势所在
OLMo 的主要优势不在于原始生成质量,而在于可复现性和可审计性。没有其他主流 LLM 系列能让你从检查点重放训练过程、检查每个数据源,并将输出追溯到其来源文档。这使得 OLMo 极其适合学术界进行 ML 研究:研究不同的训练数据混合如何改变模型行为、识别偏见来源、在受控基础上比较对齐技术,以及发表其他人可以复现的研究结果。
在生成质量方面,OLMo 2 7B 和 13B 与同等规模的领先开源权重模型相比具有竞争力。OLMo 2 7B 在 MMLU 上得分为 63.7,在 HellaSwag 上为 83.8,在 ARC-Challenge 上为 79.8,在 GSM8K 上为 67.5,在这些基准测试中均优于 Llama 3.1 8B。OLMo 2 32B 在 2025 年 3 月跨越了一个有意义的门槛,在一系列多技能学术基准测试中击败了 GPT-3.5 Turbo 和 GPT-4o mini,而其训练计算成本仅约为 Qwen 2.5 32B 的三分之一。对于无法在 Meta 的 Community License(限制月活跃用户超过 7 亿的服务)下运营的商业团队来说,Apache 2.0 许可是一个实实在在的优势。
“在无法访问训练数据的情况下研究 LLM,就等同于没有临床试验的药物研发,或者没有望远镜的太阳系研究。” - Hanna Hajishirzi,OLMo 项目负责人,AI2,VentureBeat,2024 年 2 月
“开放科学的巨大飞跃。” - Jonathan Frankle,Databricks 首席科学家,评价最初的 OLMo 发布,Business Wire,2024 年 2 月
OLMo 的局限性:用户经常遇到的故障模式
最一致的摩擦点是 OLMo 2 的 7B 和 13B 变体中 4,096 个 token 的上下文上限。虽然 Llama 3.1 扩展到了 128K 个 token,但在关于 OLMo-2-1124-13B 的 Hugging Face 论坛帖子中,有用户明确询问是否存在长上下文版本,但并未找到。文档摘要、长篇分析以及对上下文要求极高的 RAG 管道都会遇到这堵墙。
仅支持英语是一个已记录的限制。OLMo 的 Dolma 数据集以英语为中心,Tulu 3 指令训练证实,移除多语言数据会使性能下降约 0.5 分。使用西班牙语、法语、中文或任何其他语言的团队不应将 OLMo 作为生产应用程序的默认选择。
微调存在一个微妙的陷阱:预训练时间越长的模型可能越难进行指令微调。AI2 自己的研究记录了一种“灾难性过度训练”效应,即在 3 万亿个 token 上训练的 OLMo 1B 模型在微调后的表现比 2.3 万亿个 token 的检查点差了 2 个百分点以上。那些理所当然地抓取最终检查点并认为它是下游微调最佳基础的从业者可能会感到失望。
社区生态系统比 Llama 小得多。2026 年初,OLMo-2-1124-7B 在 Hugging Face 上的月下载量约为 37,000 次,而 Llama 变体的下载量则高达数百万次。虽然存在量化的 GGUF 文件(列出了 17 种量化版本),但社区微调的范围(列出了 15 种)远窄于 Llama 3 可用的数百种。与 LM Studio 和 Ollama 等消费者工具的前端集成也严重偏向 Llama 和 Mistral 的 GGUF 格式。
OLMo vs. Llama vs. SmolLM
OLMo vs. Llama (Meta): 机制上的区别在于训练数据披露和许可范围。Llama 3.1 在自定义的 Community License 下发布权重,限制了 MAU 超过 7 亿的商业使用,并且没有披露任何关于训练数据组成的信息。OLMo 在 Apache 2.0 下发布了完整的 Dolma 语料库、训练代码和所有中间检查点,没有任何使用限制。在上下文长度方面,在 7B/13B 规模下,Llama 3.1 支持 128K 个 token,而 OLMo 2 仅支持 4,096 个。在性能方面,Llama 具有更大的参数范围(8B、70B、405B)以及庞大得多的微调、量化和工具集成生态系统。OLMo 缩小了各个规模的基准测试差距,且 OLMo 2 7B 现在在标准学术基准测试中优于 Llama 3.1 8B,但 Llama 在消费者部署方面占据主导地位。如何选择取决于是否需要训练数据的可审计性。
OLMo vs. SmolLM (Hugging Face): 两者都是真正完全开源的,具有 Apache 2.0 许可并披露了训练数据。SmolLM 针对边缘部署:1.35 亿、3.6 亿和 17 亿参数,在一个包含 2520 亿个 token 的语料库(Cosmopedia v2、FineWeb-Edu、Stack-Edu-Python)上进行训练,能够在浏览器中或 CPU 上运行。OLMo 针对 7B 到 32B 参数的研究规模训练,在从更广泛的来源混合中提取的 3.9 万亿个 token 的语料库上进行训练。SmolLM 3 扩展到了 8K 上下文;OLMo 2 7B 最高为 4,096 个 token。它们并不是真正的竞争对手:SmolLM 是一个端侧推理工具,而 OLMo 是一个研究平台。想要完全开源的边缘推理的团队会选择 SmolLM;想要完全可复现的研究 LLM 的团队会选择 OLMo。
付费版本值得吗?
没有付费版本。OLMo 在任何有意义的层面上都是免费的:权重免费下载,训练数据免费下载,训练代码在 GitHub 上,且 Apache 2.0 许可允许商业部署,无需任何费用或使用报告。AI2 是一家非营利组织;该模型的存在是由研究资助而非产品收入支持的。托管 OLMo 模型的第三方云 API(Together AI、Puter、Replicate)按这些平台的典型每 token 费率收费,但那是托管成本,而不是 OLMo 许可成本。对于将 OLMo 与需要商业许可协议的开源权重模型进行评估的团队来说,比较结果显而易见:OLMo 的法律开销为零。
最佳用例以及何时应避免使用
在以下情况下使用 OLMo: 你正在进行关于预训练动态、数据管理效果或对齐技术的学术研究,并且需要可复现的基线。你是一个需要将模型输出追溯到训练源的 AI 安全团队。你需要 Apache 2.0 许可,而不受 Meta 的 Community License 在规模上的限制。你正在构建一个以科学为重点的应用程序,其中数据来源是监管或合同要求。你希望运行受控消融实验并在整个训练过程中比较检查点。
在以下情况下避免使用 OLMo: 你需要一个具有最高生成质量的生产级聊天机器人或代码助手。此时应选择前沿模型或基于 Llama 的微调模型。你正在构建多语言应用程序。你的管道依赖于 7B/13B 规模下超过 4K token 的扩展上下文。你希望拥有尽可能广泛的社区微调、适配器和量化生态系统。你需要一个足够小、可以在 CPU 或浏览器中运行的模型:SmolLM 更适合这种需求。在训练数据的完全开放性与用户体验无关的一般消费者任务中,无法从 OLMo 的独特优势中获益。
开始使用 OLMo
模型可通过 Hugging Face Transformers 使用 allenai/OLMo-2-1124-7B 模型 ID 直接加载。标准的 HuggingFace AutoModelForCausalLM 和 AutoTokenizer 类无需任何自定义代码即可工作。对于指令微调推理,allenai/OLMo-2-1124-7B-Instruct 变体应用了 Tulu 3 后训练。allenai.org 上的 AI2 Playground 提供了一个免设置的 Web 界面,用于测试 OLMo 2 32B Instruct、OLMo 2 13B Instruct 和 OLMoE 1B-7B Instruct。对于微调,AI2 在 GitHub 上的 open-instruct 存储库提供了使用与生成官方 Instruct 变体相同的 Tulu 管道的训练配方。同样可通过 AI2 Playground 访问的 OLMoTrace 允许你输入任何模型输出,并查看哪些训练文档包含匹配的片段,这对于在部署前调试、事实核查和审计模型行为非常有用。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
收录于精选合集
包含 OLMo 的精选合集。
相关文章
与 OLMo 相关的指南和文章。

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Run Open Source AI Models Locally: Battle-Tested Guide

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

DeepSeek V4 Pro vs Claude Opus 4.7: 5-PR Refactor Test (2026)
