Aller au contenu principal
Vantaige
OLMo screenshot

OLMo est la famille de modèles de langage entièrement ouverts d'AI2, qui publie non seulement les poids, mais aussi l'intégralité du jeu de données d'entraînement Dolma, tout le code d'entraînement et les points de contrôle intermédiaires sous licence Apache 2.0. C'est la référence de la communauté des chercheurs pour une science des LLM reproductible et auditable.

Fonctionnalités :APIOpen Source

OLMo est une famille de modèles de langage ouverts créés par l'Allen Institute for AI (AI2), un organisme de recherche à but non lucratif basé à Seattle. Là où la plupart des LLM « ouverts » se contentent de fournir les poids, OLMo va plus loin : chaque version inclut l'intégralité du jeu de données de pré-entraînement Dolma, le code d'entraînement, les suites d'évaluation, les états de l'optimiseur et les points de contrôle intermédiaires à chaque étape de l'entraînement. Tous les composants sont distribués sous la licence Apache 2.0, ce qui signifie aucune restriction d'utilisation, aucune barrière commerciale et aucun mystère sur ce que le modèle a appris ou d'où il l'a appris. La famille comprend les modèles denses OLMo 1B, 7B, 13B et 32B, ainsi qu'OLMoE, une variante de mélange d'experts (MoE) clairsemée avec 1 milliard de paramètres actifs sur un total de 7 milliards. Le post-entraînement utilise le pipeline Tulu, offrant aux variantes Instruct un suivi des instructions et un alignement RLHF très compétitifs.

La génération actuelle, OLMo 2, a été lancée en novembre 2024 avec des modèles 7B et 13B qui ont surpassé Llama 3.1 8B sur les benchmarks académiques. OLMo 2 32B, sorti en mars 2025, est devenu le premier modèle entièrement ouvert à battre GPT-3.5 Turbo et GPT-4o mini sur une série d'évaluations multicompétences. AI2 a également publié OLMoTrace en avril 2025, un outil qui retrace n'importe quelle sortie du modèle jusqu'aux documents d'entraînement spécifiques qui y ont probablement contribué, en utilisant l'indexation infini-gram sur 4,6 billions de tokens. Ce niveau de traçabilité est unique dans le paysage des LLM et a fait d'OLMo la plateforme de recherche de facto pour les auditeurs de sécurité de l'IA, les chercheurs sur les biais et tous ceux qui ont besoin de répondre à la question « où le modèle a-t-il appris cela ? ».

OLMo en un coup d'œil, avril 2026

La famille OLMo couvre trois gammes de produits. Les modèles denses de base (7B, 13B, 32B) utilisent une architecture transformer avec des embeddings rotatifs et sont entraînés sur le corpus Dolma, un jeu de données multisources tiré de textes web, de code, de livres, d'articles scientifiques et de contenus encyclopédiques. Les modèles OLMo 2 s'entraînent en deux étapes : l'étape 1 sur OLMo-Mix-1124 (environ 3,9 billions de tokens provenant de DCLM, Dolma, Starcoder et Proof Pile II), et l'étape 2 sur Dolmino-Mix-1124 (843 milliards de tokens de contenus web et spécifiques à un domaine de haute qualité). OLMoE est la variante MoE clairsemée : 1 milliard de paramètres actifs par passe avant sur un total de 7 milliards, entraînée sur 5 billions de tokens, et environ 2 fois plus rapide par unité de calcul qu'un modèle dense comparable. Le pipeline de post-entraînement Tulu (SFT, DPO, PPO) produit les variantes -Instruct pour chaque taille. Les fenêtres de contexte sont de 4 096 tokens pour OLMo 2 7B et 13B, étendues dans les versions ultérieures. Tous les modèles ciblent l'anglais ; le support multilingue reste limité. Les modèles sont hébergés sur l'organisation Hugging Face d'allenai et se chargent nativement via HuggingFace Transformers, vLLM et Ollama.

Les véritables points forts d'OLMo

La principale force d'OLMo n'est pas la qualité de génération brute, c'est la reproductibilité et l'auditabilité. Aucune autre grande famille de LLM ne vous permet de rejouer l'entraînement à partir d'un point de contrôle, d'inspecter chaque source de données et de retracer une sortie jusqu'au document dont elle provient. Cela rend OLMo particulièrement adapté à la recherche académique en ML : étudier comment différents mélanges de données d'entraînement modifient le comportement du modèle, identifier les sources de biais, comparer les techniques d'alignement par rapport à une base contrôlée, et publier des résultats que d'autres peuvent reproduire.

En matière de qualité de génération, OLMo 2 7B et 13B sont compétitifs par rapport aux principaux modèles à poids ouverts à échelle équivalente. OLMo 2 7B affiche 63,7 sur MMLU, 83,8 sur HellaSwag, 79,8 sur ARC-Challenge et 67,5 sur GSM8K, surpassant Llama 3.1 8B sur ces benchmarks. OLMo 2 32B a franchi un cap significatif en mars 2025, surpassant GPT-3.5 Turbo et GPT-4o mini sur une série de benchmarks académiques multicompétences, et ce pour environ un tiers du coût de calcul d'entraînement de Qwen 2.5 32B. La licence Apache 2.0 est un avantage concret pour les équipes commerciales qui ne peuvent pas opérer sous la Community License de Meta (qui restreint les services de plus de 700 millions d'utilisateurs actifs mensuels).

« Étudier les LLM sans avoir accès aux données d'entraînement équivaut à découvrir des médicaments sans essais cliniques ou à étudier le système solaire sans télescope. » - Hanna Hajishirzi, chef de projet OLMo, AI2, VentureBeat, février 2024
« Un pas de géant pour la science ouverte. » - Jonathan Frankle, scientifique en chef chez Databricks, à propos de la version initiale d'OLMo, Business Wire, février 2024

Les limites d'OLMo : les obstacles rencontrés par les utilisateurs

Le point de friction le plus constant est le plafond de contexte de 4 096 tokens dans les variantes 7B et 13B d'OLMo 2. Alors que Llama 3.1 s'étend jusqu'à 128K tokens, un fil de discussion sur le forum Hugging Face concernant OLMo-2-1124-13B montre des utilisateurs demandant explicitement s'il existe une version à contexte long, sans en trouver. Le résumé de documents, l'analyse de formats longs et les pipelines RAG qui sollicitent fortement le contexte se heurteront à ce mur.

La couverture exclusivement anglophone est une limitation documentée. Le jeu de données Dolma d'OLMo est centré sur l'anglais, et l'entraînement Instruct Tulu 3 a confirmé que la suppression des données multilingues dégradait les performances d'environ 0,5 point. Les équipes travaillant en espagnol, en français, en chinois ou dans toute autre langue ne devraient pas choisir OLMo par défaut pour des applications en production.

Le fine-tuning comporte un piège subtil : les modèles pré-entraînés plus longtemps peuvent être plus difficiles à ajuster aux instructions. Les propres recherches d'AI2 ont documenté un effet de « surentraînement catastrophique » où le modèle OLMo 1B entraîné sur 3 billions de tokens a enregistré des performances inférieures de plus de 2 points de pourcentage après le fine-tuning par rapport au point de contrôle de 2,3 billions de tokens. Les praticiens qui récupèrent le point de contrôle final en supposant qu'il s'agit de la meilleure base pour un fine-tuning en aval risquent d'être déçus.

L'écosystème communautaire est nettement plus restreint que celui de Llama. OLMo-2-1124-7B comptait environ 37 000 téléchargements mensuels sur Hugging Face début 2026, contre des millions pour les variantes de Llama. Des fichiers GGUF quantifiés existent (17 quantifications répertoriées) mais la gamme de fine-tunes communautaires (15 répertoriés) est beaucoup plus étroite que les centaines disponibles pour Llama 3. Les intégrations front-end avec des outils grand public comme LM Studio et Ollama penchent fortement vers les formats GGUF de Llama et Mistral.

OLMo vs. Llama vs. SmolLM

OLMo vs. Llama (Meta) : La différence mécanique réside dans la divulgation des données d'entraînement et la portée de la licence. Llama 3.1 publie ses poids sous une Community License personnalisée qui restreint l'utilisation commerciale au-delà de 700 millions de MAU (utilisateurs actifs mensuels) et ne divulgue rien sur la composition des données d'entraînement. OLMo publie l'intégralité du corpus Dolma, le code d'entraînement et tous les points de contrôle intermédiaires sous licence Apache 2.0 sans aucune restriction d'utilisation. Sur la longueur du contexte, Llama 3.1 prend en charge 128K tokens contre 4 096 pour OLMo 2 à l'échelle 7B/13B. En termes de performances, Llama dispose d'une plage de paramètres plus large (8B, 70B, 405B) et d'un écosystème de fine-tunes, de quantifications et d'intégrations d'outils beaucoup plus vaste. OLMo réduit l'écart de référence à chaque échelle, et OLMo 2 7B surpasse désormais Llama 3.1 8B sur les benchmarks académiques standards, mais Llama domine pour le déploiement grand public. Le choix dépend de la nécessité ou non d'auditer les données d'entraînement.

OLMo vs. SmolLM (Hugging Face) : Les deux sont véritablement et entièrement ouverts avec des licences Apache 2.0 et des données d'entraînement divulguées. SmolLM cible le déploiement en périphérie (edge) : 135M, 360M et 1,7B de paramètres entraînés sur un corpus de 252 milliards de tokens (Cosmopedia v2, FineWeb-Edu, Stack-Edu-Python), capables de s'exécuter dans le navigateur ou sur CPU. OLMo cible l'entraînement à l'échelle de la recherche de 7B à 32B de paramètres sur un corpus de 3,9 billions de tokens tiré d'un mélange de sources plus large. SmolLM 3 s'étend jusqu'à un contexte de 8K ; OLMo 2 7B plafonne à 4 096 tokens. Ce ne sont pas de vrais concurrents : SmolLM est un outil d'inférence sur appareil, OLMo est une plateforme de recherche. Une équipe souhaitant une inférence edge entièrement ouverte choisira SmolLM ; une équipe souhaitant un LLM de recherche entièrement reproductible choisira OLMo.

La version payante en vaut-elle la peine ?

Il n'y a pas de version payante. OLMo est gratuit dans tous les sens du terme : les poids se téléchargent gratuitement, les données d'entraînement se téléchargent gratuitement, le code d'entraînement est sur GitHub, et la licence Apache 2.0 permet un déploiement commercial sans aucun frais ni rapport d'utilisation. AI2 est une organisation à but non lucratif ; l'existence du modèle est financée par des subventions de recherche plutôt que par les revenus des produits. Les API cloud tierces (Together AI, Puter, Replicate) qui hébergent les modèles OLMo facturent des tarifs par token typiques de ces plateformes, mais il s'agit d'un coût d'hébergement, pas d'un coût de licence OLMo. Pour les équipes évaluant OLMo par rapport à des modèles à poids ouverts qui nécessitent des accords de licence commerciale, la comparaison se résume à ceci : OLMo coûte zéro en frais juridiques.

Meilleurs cas d'usage et quand l'éviter

Utilisez OLMo lorsque : Vous menez des recherches académiques sur la dynamique de pré-entraînement, les effets de la curation des données ou les techniques d'alignement et avez besoin de bases de référence reproductibles. Vous êtes une équipe de sécurité de l'IA qui a besoin de retracer les sorties du modèle jusqu'aux sources d'entraînement. Vous avez besoin d'une licence Apache 2.0 sans les restrictions que la Community License de Meta impose à grande échelle. Vous créez une application axée sur la science où la provenance des données est une exigence réglementaire ou contractuelle. Vous souhaitez exécuter des ablations contrôlées et comparer les points de contrôle tout au long de l'entraînement.

Évitez OLMo lorsque : Vous avez besoin d'un chatbot ou d'un assistant de code de qualité production avec une qualité de génération maximale. Optez plutôt pour un modèle de pointe ou un fine-tune basé sur Llama. Vous créez des applications multilingues. Votre pipeline dépend d'un contexte étendu au-delà de 4K tokens à l'échelle 7B/13B. Vous souhaitez l'écosystème le plus large possible de fine-tunes, d'adaptateurs et de quantifications communautaires. Vous avez besoin d'un modèle suffisamment petit pour s'exécuter sur un CPU ou dans un navigateur : SmolLM répond mieux à ce besoin. Les tâches grand public générales où l'ouverture totale des données d'entraînement n'est pas pertinente pour l'expérience utilisateur ne bénéficient pas de ce qui distingue OLMo.

Premiers pas avec OLMo

Les modèles se chargent directement via HuggingFace Transformers en utilisant l'ID de modèle allenai/OLMo-2-1124-7B. Les classes standards AutoModelForCausalLM et AutoTokenizer de Hugging Face fonctionnent sans aucun code personnalisé. Pour l'inférence ajustée aux instructions, la variante allenai/OLMo-2-1124-7B-Instruct applique le post-entraînement Tulu 3. L'AI2 Playground sur allenai.org fournit une interface web sans configuration pour tester OLMo 2 32B Instruct, OLMo 2 13B Instruct et OLMoE 1B-7B Instruct. Pour le fine-tuning, le dépôt open-instruct d'AI2 sur GitHub fournit des recettes d'entraînement utilisant le même pipeline Tulu que celui utilisé pour produire les variantes Instruct officielles. OLMoTrace, également accessible via l'AI2 Playground, vous permet de saisir n'importe quelle sortie du modèle et de voir quels documents d'entraînement contiennent des segments correspondants, ce qui est utile pour le débogage, la vérification des faits et l'audit du comportement du modèle avant le déploiement.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant OLMo.

Articles associés

Guides et articles en lien avec OLMo.