Saltar al contenido principal
Vantaige
OLMo screenshot

OLMo es la familia de modelos de lenguaje totalmente abiertos de AI2, que publica no solo los pesos, sino también el conjunto de datos de entrenamiento completo Dolma, todo el código de entrenamiento y los puntos de control intermedios bajo la licencia Apache 2.0. Es la opción preferida de la comunidad investigadora para la ciencia de LLM reproducible y auditable.

Funciones:APIOpen Source

OLMo es una familia de modelos de lenguaje abiertos creados por el Allen Institute for AI (AI2), una organización de investigación sin fines de lucro con sede en Seattle. Mientras que la mayoría de los LLM "abiertos" te dan los pesos y dan el trabajo por terminado, OLMo va más allá: cada lanzamiento incluye el conjunto de datos de preentrenamiento completo Dolma, el código de entrenamiento, las suites de evaluación, los estados del optimizador y los puntos de control intermedios en cada etapa del entrenamiento. Todos los componentes se distribuyen bajo la licencia Apache 2.0, lo que significa que no hay restricciones de uso, ni barreras comerciales, ni misterios sobre qué aprendió el modelo o de dónde lo aprendió. La familia abarca los modelos densos OLMo 1B, 7B, 13B y 32B, además de OLMoE, una variante dispersa de mezcla de expertos (MoE) con mil millones de parámetros activos extraídos de un total de 7 mil millones. El post-entrenamiento utiliza la canalización Tulu, lo que otorga a las variantes de instrucción un seguimiento de instrucciones competitivo y alineación RLHF.

La generación actual, OLMo 2, se lanzó en noviembre de 2024 con modelos de 7B y 13B que superaron a Llama 3.1 8B en los puntos de referencia académicos. OLMo 2 32B, lanzado en marzo de 2025, se convirtió en el primer modelo totalmente abierto en superar a GPT-3.5 Turbo y GPT-4o mini en un conjunto de evaluaciones de múltiples habilidades. AI2 también lanzó OLMoTrace en abril de 2025, una herramienta que rastrea cualquier resultado del modelo hasta los documentos de entrenamiento específicos que probablemente contribuyeron a él, utilizando la indexación infini-gram en 4.6 billones de tokens. Este nivel de trazabilidad es único en el panorama de los LLM y ha convertido a OLMo en la plataforma de investigación de facto para auditores de seguridad de IA, investigadores de sesgos y cualquiera que necesite responder a la pregunta "¿dónde aprendió esto el modelo?".

OLMo de un vistazo, abril de 2026

La familia OLMo abarca tres líneas de productos. Los modelos densos base (7B, 13B, 32B) utilizan una arquitectura transformer con incrustaciones rotatorias y se entrenaron en el corpus Dolma, un conjunto de datos de múltiples fuentes que extrae texto web, código, libros, artículos científicos y contenido enciclopédico. Los modelos OLMo 2 se entrenan en dos etapas: la Etapa 1 en OLMo-Mix-1124 (alrededor de 3.9 billones de tokens de DCLM, Dolma, Starcoder y Proof Pile II), y la Etapa 2 en Dolmino-Mix-1124 (843 mil millones de tokens de contenido web y de dominio específico de alta calidad y curado). OLMoE es la variante dispersa MoE: mil millones de parámetros activos por pasada hacia adelante de un total de 7 mil millones, entrenado en 5 billones de tokens, y entrenado aproximadamente 2 veces más rápido por unidad de cómputo que un modelo denso comparable. La canalización de post-entrenamiento Tulu (SFT, DPO, PPO) produce las variantes -Instruct para cada tamaño. Las ventanas de contexto son de 4,096 tokens para OLMo 2 7B y 13B, ampliadas en versiones posteriores. Todos los modelos están orientados al inglés; el soporte multilingüe sigue siendo limitado. Los modelos están alojados en la organización allenai de Hugging Face y se cargan de forma nativa a través de HuggingFace Transformers, vLLM y Ollama.

En qué destaca realmente OLMo

El principal punto fuerte de OLMo no es la calidad de generación bruta, sino la reproducibilidad y la auditabilidad. Ninguna otra familia importante de LLM te permite reproducir el entrenamiento desde un punto de control, inspeccionar cada fuente de datos y rastrear un resultado hasta el documento del que proviene. Esto hace que OLMo sea especialmente adecuado para la investigación académica de ML: estudiar cómo las diferentes mezclas de datos de entrenamiento cambian el comportamiento del modelo, identificar fuentes de sesgo, comparar técnicas de alineación con una base controlada y publicar hallazgos que otros puedan reproducir.

En cuanto a la calidad de generación, OLMo 2 7B y 13B son competitivos con los principales modelos de pesos abiertos a una escala equivalente. OLMo 2 7B registra 63.7 en MMLU, 83.8 en HellaSwag, 79.8 en ARC-Challenge y 67.5 en GSM8K, superando a Llama 3.1 8B en estos puntos de referencia. OLMo 2 32B cruzó un umbral significativo en marzo de 2025, superando a GPT-3.5 Turbo y GPT-4o mini en un conjunto de puntos de referencia académicos de múltiples habilidades, haciéndolo a aproximadamente un tercio del costo de cómputo de entrenamiento de Qwen 2.5 32B. La licencia Apache 2.0 es una ventaja concreta para los equipos comerciales que no pueden operar bajo la Licencia Comunitaria de Meta (que restringe los servicios con más de 700 millones de usuarios activos mensuales).

"Estudiar los LLM sin acceso a los datos de entrenamiento es el equivalente al descubrimiento de fármacos sin ensayos clínicos o a estudiar el sistema solar sin un telescopio". - Hanna Hajishirzi, líder del proyecto OLMo, AI2, VentureBeat, febrero de 2024
"Un gran salto para la ciencia abierta". - Jonathan Frankle, científico jefe de Databricks, sobre el lanzamiento original de OLMo, Business Wire, febrero de 2024

Dónde falla OLMo: los problemas recurrentes de los usuarios

El punto de fricción más constante es el límite de contexto de 4,096 tokens en las variantes de 7B y 13B de OLMo 2. Mientras que Llama 3.1 se extiende a 128K tokens, un hilo del foro de Hugging Face sobre OLMo-2-1124-13B incluye a usuarios preguntando explícitamente si existe una versión de contexto largo y no encontrando ninguna. El resumen de documentos, el análisis de formato largo y las canalizaciones RAG que exigen mucho contexto chocarán contra este muro.

La cobertura exclusiva en inglés es una limitación documentada. El conjunto de datos Dolma de OLMo está centrado en el inglés, y el entrenamiento de instrucción Tulu 3 confirmó que la eliminación de datos multilingües degradó el rendimiento en aproximadamente 0.5 puntos. Los equipos que trabajan en español, francés, chino o cualquier otro idioma no deberían elegir OLMo por defecto para aplicaciones de producción.

El ajuste fino (fine-tuning) tiene una trampa sutil: los modelos preentrenados durante más tiempo pueden ser más difíciles de ajustar a las instrucciones. La propia investigación de AI2 documentó un efecto de "sobreentrenamiento catastrófico" en el que el modelo OLMo 1B entrenado en 3 billones de tokens tuvo un rendimiento más de 2 puntos porcentuales peor después del ajuste fino que el punto de control de 2.3 billones de tokens. Los profesionales que toman el punto de control final asumiendo que es la mejor base para el ajuste fino posterior pueden sentirse decepcionados.

El ecosistema de la comunidad es mucho más pequeño que el de Llama. OLMo-2-1124-7B tuvo aproximadamente 37,000 descargas mensuales en Hugging Face a principios de 2026, frente a los millones de las variantes de Llama. Existen archivos GGUF cuantizados (17 cuantizaciones enumeradas), pero la gama de ajustes finos de la comunidad (15 enumerados) es mucho más reducida que los cientos disponibles para Llama 3. Las integraciones de frontend con herramientas de consumo como LM Studio y Ollama se inclinan fuertemente hacia los formatos GGUF de Llama y Mistral.

OLMo vs. Llama vs. SmolLM

OLMo vs. Llama (Meta): La diferencia mecánica es la divulgación de los datos de entrenamiento y el alcance de la licencia. Llama 3.1 publica los pesos bajo una Licencia Comunitaria personalizada que restringe el uso comercial por encima de los 700 millones de MAU (usuarios activos mensuales) y no revela nada sobre la composición de los datos de entrenamiento. OLMo publica el corpus Dolma completo, el código de entrenamiento y todos los puntos de control intermedios bajo Apache 2.0 sin restricciones de uso. En cuanto a la longitud del contexto, Llama 3.1 admite 128K tokens frente a los 4,096 de OLMo 2 a escala 7B/13B. En cuanto al rendimiento, Llama tiene un rango de parámetros mayor (8B, 70B, 405B) y un ecosistema mucho más amplio de ajustes finos, cuantizaciones e integraciones de herramientas. OLMo reduce la brecha en los puntos de referencia en cada escala, y OLMo 2 7B ahora supera a Llama 3.1 8B en los puntos de referencia académicos estándar, pero Llama domina para la implementación en el consumidor. La elección depende de si la auditabilidad de los datos de entrenamiento es un requisito.

OLMo vs. SmolLM (Hugging Face): Ambos son genuinamente abiertos con licencias Apache 2.0 y datos de entrenamiento divulgados. SmolLM se centra en la implementación en el borde (edge): 135M, 360M y 1.7B de parámetros entrenados en un corpus de 252 mil millones de tokens (Cosmopedia v2, FineWeb-Edu, Stack-Edu-Python), capaz de ejecutarse en el navegador o en la CPU. OLMo se centra en el entrenamiento a escala de investigación de 7B a 32B de parámetros en un corpus de 3.9 billones de tokens extraído de una mezcla de fuentes más amplia. SmolLM 3 se extiende a un contexto de 8K; OLMo 2 7B alcanza un máximo de 4,096 tokens. No son competidores reales: SmolLM es una herramienta de inferencia en el dispositivo, OLMo es una plataforma de investigación. Un equipo que desee inferencia en el borde totalmente abierta elige SmolLM; un equipo que desee un LLM de investigación totalmente reproducible elige OLMo.

¿Vale la pena el plan de pago?

No hay plan de pago. OLMo es gratuito en todos los sentidos: los pesos se descargan gratis, los datos de entrenamiento se descargan gratis, el código de entrenamiento está en GitHub y la licencia Apache 2.0 permite la implementación comercial sin tarifas ni informes de uso. AI2 es una organización sin fines de lucro; la existencia del modelo se financia con subvenciones de investigación en lugar de ingresos por productos. Las API en la nube de terceros (Together AI, Puter, Replicate) que alojan modelos OLMo cobran tarifas por token típicas de esas plataformas, pero eso es un costo de alojamiento, no un costo de licencia de OLMo. Para los equipos que evalúan OLMo frente a modelos de pesos abiertos que requieren acuerdos de licencia comercial, la comparación se reduce a: OLMo cuesta cero en gastos legales.

Mejores casos de uso y cuándo evitarlo

Usa OLMo cuando: Estés realizando una investigación académica sobre la dinámica del preentrenamiento, los efectos de la curación de datos o las técnicas de alineación y necesites líneas base reproducibles. Seas un equipo de seguridad de IA que necesita rastrear los resultados del modelo hasta las fuentes de entrenamiento. Necesites la licencia Apache 2.0 sin las restricciones que conlleva la Licencia Comunitaria de Meta a gran escala. Estés creando una aplicación centrada en la ciencia donde la procedencia de los datos sea un requisito normativo o contractual. Quieras ejecutar ablaciones controladas y comparar puntos de control a lo largo de la ejecución del entrenamiento.

Evita OLMo cuando: Necesites un chatbot o asistente de código con calidad de producción y la máxima calidad de generación. En su lugar, opta por un modelo de frontera o un ajuste fino basado en Llama. Estés creando aplicaciones multilingües. Tu canalización dependa de un contexto extendido más allá de los 4K tokens a escala 7B/13B. Quieras el ecosistema más amplio posible de ajustes finos, adaptadores y cuantizaciones de la comunidad. Necesites un modelo lo suficientemente pequeño como para ejecutarse en una CPU o en un navegador: SmolLM se adapta mejor a esa necesidad. Las tareas generales de los consumidores en las que la apertura total de los datos de entrenamiento es irrelevante para la experiencia del usuario no se benefician de lo que hace que OLMo sea distinto.

Primeros pasos con OLMo

Los modelos se cargan directamente a través de Hugging Face Transformers utilizando el ID de modelo allenai/OLMo-2-1124-7B. Las clases estándar AutoModelForCausalLM y AutoTokenizer de HuggingFace funcionan sin ningún código personalizado. Para la inferencia ajustada a instrucciones, la variante allenai/OLMo-2-1124-7B-Instruct aplica el post-entrenamiento Tulu 3. El AI2 Playground en allenai.org proporciona una interfaz web sin configuración para probar OLMo 2 32B Instruct, OLMo 2 13B Instruct y OLMoE 1B-7B Instruct. Para el ajuste fino, el repositorio open-instruct de AI2 en GitHub proporciona recetas de entrenamiento utilizando la misma canalización Tulu que se usa para producir las variantes de instrucción oficiales. OLMoTrace, también accesible a través del AI2 Playground, te permite ingresar cualquier resultado del modelo y ver qué documentos de entrenamiento contienen fragmentos coincidentes, lo que resulta útil para la depuración, la verificación de datos y la auditoría del comportamiento del modelo antes de la implementación.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen OLMo.

Artículos relacionados

Guías y artículos relacionados con OLMo.