Saltar al contenido principal
Vantaige
MLX screenshot

MLX es el framework de matrices de código abierto de Apple ML Research para ejecutar y ajustar modelos de aprendizaje automático en Apple Silicon. Es gratuito, con licencia MIT y está diseñado para extraer el máximo rendimiento de los chips M1 a M5 utilizando memoria unificada.

Funciones:Open Source

MLX es un framework de matrices de código abierto para el aprendizaje automático, lanzado por Apple ML Research en diciembre de 2023 bajo la licencia MIT. Está diseñado específicamente para los chips Apple Silicon (M1, M2, M3, M4 y M5) y se basa en una ventaja arquitectónica fundamental: la memoria unificada de Apple, donde la CPU y la GPU comparten el mismo grupo físico de RAM. Este diseño elimina el cuello de botella de la copia de datos que ralentiza a frameworks como PyTorch al mover tensores entre tipos de procesadores. El resultado es que MLX puede ejecutar grandes modelos de lenguaje más rápido en un MacBook que la mayoría de las alternativas, sin necesidad de suscripciones en la nube de pago ni API externas.

El framework expone API para Python, C++, C y Swift. La interfaz de Python refleja las convenciones de NumPy; las capas de redes neuronales y optimizadores de nivel superior siguen los modismos de PyTorch, por lo que los investigadores familiarizados con cualquiera de ellos pueden aprender a usarlo rápidamente. MLX-LM, el paquete complementario para la inferencia y el ajuste fino (fine-tuning) de LLM, gestiona las descargas de modelos desde Hugging Face, la cuantización (4-bit, 8-bit, bf16), el almacenamiento en caché de prompts, la caché rotativa de clave-valor para la eficiencia de la memoria, el ajuste fino con LoRA y QLoRA, y la inferencia distribuida en múltiples Mac. La instalación se realiza con un solo comando pip. La comunidad MLX en Hugging Face aloja miles de modelos precuantizados listos para ejecutarse. A partir de abril de 2026, MLX se encuentra en la versión 0.31.2 con 73 lanzamientos y mantenimiento activo por parte de los ingenieros de Apple.

Lo que MLX realmente hace en mayo de 2026

MLX es el motor de inferencia y entrenamiento para cargas de trabajo de ML locales en Mac. En el lado de la inferencia, MLX-LM permite extraer cualquier modelo de Hugging Face, cuantizarlo sobre la marcha y ejecutar una interfaz de chat directamente desde el terminal. No hay ningún servidor que configurar, ni contenedor Docker, ni pila de controladores de GPU. En un M3 Max con 96GB de memoria unificada, se puede cargar un Llama 70B de 4-bit y generar de 10 a 15 tokens por segundo. En un M4 Max ejecutando un modelo Mixture-of-Experts de 35B, los benchmarks reales muestran aproximadamente 130 tokens por segundo. El chip M5 redujo el tiempo hasta el primer token a menos de 10 segundos para arquitecturas densas de 14B, y a menos de 3 segundos para modelos MoE de 30B, con los nuevos GPU Neural Accelerators de Apple proporcionando circuitos dedicados de multiplicación de matrices que MLX direcciona directamente a través de Metal 4.

En el lado del entrenamiento, MLX admite el ajuste fino con LoRA y QLoRA mediante un solo comando. Se especifica el modelo, el conjunto de datos en formato JSONL y la duración del entrenamiento. Entrenar Mistral-7B con 5,000 ejemplos toma aproximadamente de 45 a 90 minutos en un M2 Max, con un pico de memoria de alrededor de 7GB a máxima precisión. El entrenamiento en un modelo cuantizado de 4-bit reduce la memoria aproximadamente 3.5 veces con una pérdida mínima de precisión. Los adaptadores se pueden subir luego a Hugging Face y compartirse. El entrenamiento distribuido está disponible a través de mx.distributed para equipos con múltiples máquinas Apple Silicon.

La computación perezosa (lazy computation) significa que las matrices solo se evalúan cuando se necesitan los resultados. Los gráficos de computación dinámica se reconstruyen cuando cambian las formas de entrada, evitando la lenta recompilación durante la iteración de la investigación. La API de Swift es lo suficientemente estable como para que los desarrolladores de aplicaciones de iOS y macOS integren modelos directamente en las aplicaciones sin depender de la nube. En la WWDC 2025, Apple dedicó tres sesiones exclusivas a MLX, posicionándolo como el framework preferido para la inferencia de LLM en Apple Silicon. El anuncio de marzo de 2026 de que Ollama cambiaría a MLX como su motor de inferencia, ofreciendo una generación de respuestas 2 veces más rápida en su versión beta, validó el framework como una infraestructura lista para producción.

Dónde se sitúa MLX frente a llama.cpp y PyTorch MPS

MLX vs. llama.cpp: llama.cpp utiliza el formato GGUF y se ejecuta en CPU, Metal, Vulkan, CUDA y otros backends. Es genuinamente multiplataforma: Windows, Linux, macOS, Android. MLX se ejecuta solo en macOS. En rendimiento bruto para modelos de menos de 14B de parámetros, MLX gana claramente: un M2 Ultra con Qwen-2.5 7B alcanza alrededor de 230 tok/s en MLX frente a 150 tok/s en llama.cpp, una ventaja del 53%. En un M4 Max con un modelo de 0.6B, MLX registra 525 tok/s frente a los 281 tok/s de llama.cpp. A partir de los 27B de parámetros, donde el ancho de banda de la memoria es el cuello de botella, ambos frameworks convergen y el rendimiento se vuelve aproximadamente igual.

La diferencia arquitectónica significativa es el manejo de la memoria. MLX utiliza verdadera memoria unificada de copia cero (zero-copy) a través de la evaluación perezosa. llama.cpp utiliza la división de capas de CPU+GPU mediante el indicador -ngl, lo que significa que se puede cargar un modelo más grande que la memoria de la GPU desbordando capas a la RAM de la CPU. MLX no tiene una capacidad equivalente: si el modelo no cabe en la memoria unificada, no se ejecutará. llama.cpp también admite más de 10 formatos de cuantización (Q2_K, Q4_0, Q8_0, variantes IQ) frente a los cuatro de MLX. Además, llama.cpp es solo para inferencia; MLX incluye el ajuste fino nativo con LoRA en el dispositivo. Para los usuarios de Windows o Linux, o aquellos que necesitan cargar modelos cerca o por encima de su límite de memoria, llama.cpp es la opción pragmática. Para la inferencia prioritaria en Mac, donde el rendimiento importa y los modelos caben cómodamente en la memoria, MLX es el ganador.

MLX vs. backend PyTorch MPS: El backend Metal Performance Shaders de PyTorch permite a los usuarios de Mac ejecutar código PyTorch existente en la GPU de Apple. Para la generación de tokens de modelos de lenguaje, la brecha es grande: MLX alcanza alrededor de 230 tok/s en un M2 Ultra para la inferencia de LLM; PyTorch MPS logra de 7 a 9 tok/s. No es un error tipográfico. La diferencia proviene de la arquitectura de memoria unificada: PyTorch sigue copiando tensores entre la CPU y la GPU de la manera tradicional, incurriendo en una sobrecarga que MLX evita por completo. Un benchmark en un M3 Pro encontró que PyTorch MPS era 5.5 veces más rápido que MLX para la multiplicación de matrices en bruto (128x128, 10K iteraciones), lo que demuestra que la ventaja de MLX está optimizada específicamente para cargas de trabajo de LLM de extremo a extremo, no para cada operación primitiva. Si se tiene un gran pipeline de entrenamiento de PyTorch existente y se desea ejecutarlo en Mac sin reescribirlo, PyTorch MPS es la vía de compatibilidad. Si se está empezando desde cero y se desea el mejor rendimiento de LLM en Mac, MLX es la base adecuada.

"Esto es extremadamente impresionante, la cantidad de avance técnico aquí cambia totalmente la forma en que estoy pensando en mi próxima aplicación." - Nathan Tarbert, desarrollador, hilo de la sesión de la WWDC 2025 en dev.to, junio de 2025
"Cuando ejecuté este código por primera vez y vi aparecer texto en mi pantalla, generado completamente en mi portátil sin ninguna llamada a la API, se sintió como una pequeña revolución. Mi MacBook se convirtió de repente en una potencia de IA autónoma." - testimonio de desarrollador, willitrunai.com, 2025

Cómo es la realidad diaria del desarrollo

Empezar es genuinamente rápido. Instale MLX-LM con pip en un entorno virtual, luego ejecute un comando para iniciar una sesión de chat apuntando a cualquier slug de modelo de Hugging Face. El modelo se descarga y se cuantiza automáticamente. Puede cambiar de Mistral-7B a Llama-3-70B cambiando un indicador. El almacenamiento en caché de prompts significa que las sesiones repetidas de contexto largo no vuelven a procesar el contexto completo en cada turno, lo cual es importante para los agentes de codificación que mantienen prompts de sistema largos.

El ajuste fino sigue un patrón similar. Prepare sus datos como JSONL, ejecute mlx_lm.lora con el modelo, la ruta de los datos y el recuento de iteraciones. Sin instalación de controladores CUDA, sin configuración de variables de entorno, sin matriz de compatibilidad por la que navegar. Un desarrollador describió el ajuste fino de Mistral-7B para generar documentación de API en un formato específico, y toda la ejecución tomó 45 minutos en un MacBook Pro con un pico de memoria de alrededor de 6.8GB. El entrenamiento en un modelo base cuantizado de 4-bit reduce la memoria aproximadamente 3.5 veces, lo que hace factible el ajuste fino de modelos de 13B en sistemas de 24GB.

La integración con otras herramientas sigue mejorando. LM Studio ahora admite MLX como backend, brindando a los usuarios una interfaz gráfica sobre la inferencia de MLX. Ollama anunció en marzo de 2026 que había cambiado a MLX como su motor de inferencia en Apple Silicon, ofreciendo a los usuarios de Ollama una generación 2 veces más rápida sin ningún cambio en el flujo de trabajo. La comunidad MLX de Hugging Face aloja miles de modelos precuantizados en formato safetensors, cubriendo la mayoría de las arquitecturas que de otro modo solo aparecerían primero en GGUF. Los usuarios que desean ejecutar modelos en una GUI junto con búsquedas web o flujos de trabajo de documentos a menudo combinan la inferencia de MLX con la capa de API REST de Ollama, aceptando una modesta sobrecarga de rendimiento por la conveniencia de los endpoints estandarizados.

El lanzamiento público de diciembre de 2023 fue notable para Apple. La compañía lanzó MLX en GitHub sin una conferencia de prensa el 5 de diciembre de 2023, la misma semana en que Google lanzó Gemini. La cobertura de la prensa tecnológica se centró casi por completo en Gemini. En cuestión de días, la comunidad de ML había encontrado MLX y los benchmarks iniciales mostraron un rendimiento un 30% más rápido que PyTorch para algunas cargas de trabajo en hardware de Apple. La licencia MIT se interpretó como una fuerte señal: Apple no estaba tratando de controlar el ecosistema de la forma en que CUDA vinculó el mundo de las GPU a NVIDIA. Ese enfoque aceleró la adopción entre los investigadores que habían sido escépticos sobre la seriedad de Apple en materia de IA.

Para quién está diseñado MLX

MLX es la opción correcta para los investigadores y desarrolladores de ML basados en Mac que desean ejecutar o ajustar grandes modelos de lenguaje sin costos en la nube ni enviar datos fuera del dispositivo. Los científicos de datos frustrados por las velocidades de inferencia de PyTorch MPS encontrarán en MLX una mejora sustancial. Los profesionales centrados en la privacidad que no pueden enviar datos a API externas tienen una razón clara para adoptarlo: toda la inferencia y el entrenamiento permanecen en la máquina local. Los desarrolladores de Swift que crean aplicaciones para iOS o macOS con modelos integrados pueden usar la API de Swift de MLX sin una capa de intérprete de Python. Los equipos que construyen en el ecosistema de Apple a largo plazo deberían tratar a MLX como una dependencia estratégica, dada la optimización intencional del hardware M5 de Apple para las cargas de trabajo de MLX.

Los usuarios que deseen explorar una amplia gama de modelos de pesos abiertos en múltiples plataformas también deberían echar un vistazo a llama.cpp y Llama directamente, ya que el ecosistema GGUF de llama.cpp ofrece una mayor disponibilidad de modelos para las arquitecturas recién lanzadas. Las dos herramientas se complementan entre sí dependiendo de la tarea.

Lo que MLX no es

MLX no es un framework multiplataforma. Si su equipo incluye desarrolladores de Windows o Linux, o si implementa modelos en servidores Linux, MLX no podrá acompañarle allí. llama.cpp se ejecuta en las tres plataformas con los mismos archivos de modelo. Los modelos safetensors de MLX no se pueden portar.

MLX no maneja modelos que excedan la memoria unificada. No hay desbordamiento de capas a la CPU al estilo de -ngl. Si su Mac tiene 24GB de memoria unificada y desea cargar un modelo de 32B a una precisión de 8-bit, MLX se negará. llama.cpp puede dividir ese modelo entre la CPU y la GPU. Esto es importante para los usuarios con modelos base M1 o M2 (8-16GB) que desean ejecutar cualquier cosa más grande que un 7B con una calidad decente.

El rendimiento de prellenado (prefill) es una debilidad genuina. Para intercambios de chat cortos, la ventaja de generación de MLX puede verse superada por su procesamiento de prompts más lento. Un prompt de 650 tokens en un M1 Max reportó que el 94% del tiempo se gastó en el prellenado, colapsando el rendimiento efectivo por debajo de llama.cpp. Los chips M1 y M2 carecen de soporte nativo para bf16, lo que agrava el problema en hardware más antiguo.

MLX no es una plataforma de servicio de LLM para producción. No hay procesamiento por lotes de solicitudes (batching) integrado, limitación de velocidad ni gestión de sesiones multiusuario. El ecosistema de servidores basados en MLX (servidor mlx-lm, Rapid-MLX, vLLM-MLX, oMLX) todavía está fragmentado. Para un solo desarrollador en su propia máquina, eso está bien. Para los equipos que implementan un endpoint interno compartido, las herramientas aún no están maduras.

Por último, MLX no es una herramienta para principiantes. No hay una interfaz gráfica directamente de Apple. El punto de entrada principal es un terminal de Python. Los usuarios que deseen una experiencia de GUI pulida deberían comenzar con LM Studio u Ollama con un frontend de GUI, que ahora usan MLX bajo el capó de todos modos en Apple Silicon sin requerir que interactúe con el framework directamente.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen MLX.

Artículos relacionados

Guías y artículos relacionados con MLX.