Saltar al contenido principal
Vantaige
MiniMax (Modelos de texto) screenshot
MiniMax (Modelos de texto) logo

MiniMax (Modelos de texto)

De pago

MiniMax es un laboratorio de IA con sede en Shanghái que ofrece una serie de modelos de texto de vanguardia, desde el M1 de 456B de parámetros hasta el buque insignia M2.7. Conocido por su contexto de 1M de tokens, pesos abiertos bajo licencia Apache 2.0 y una sólida programación de agentes a precios muy inferiores a los de las alternativas occidentales.

Funciones:API

MiniMax es una empresa de investigación en IA con sede en Shanghái fundada a principios de 2022, que opera una línea de grandes modelos de lenguaje que compiten directamente con los sistemas de pesos abiertos más capaces del mundo. La serie de modelos de texto del laboratorio, que abarca MiniMax-Text-01, M1, M2 y el actual buque insignia M2.7, cubre el razonamiento de contexto largo, la ingeniería de software y la ejecución de tareas de agentes en múltiples pasos. Este listado cubre únicamente la API del modelo de texto, independiente de la plataforma de video Hailuo de MiniMax y de sus productos de generación de audio y música, los cuales atienden casos de uso completamente diferentes.

La API de texto de MiniMax es accesible en platform.minimax.io, a través de un endpoint compatible con Anthropic o mediante OpenRouter. La línea incluye modelos de pesos abiertos bajo Apache 2.0 (M1, M2) y variantes propietarias. Las ventanas de contexto van desde 66K tokens en la variante de juego de rol M2-Her hasta 1 millón de tokens en M1 y MiniMax-01, con una capacidad de extrapolación reportada de 4M de tokens en inferencia. Los precios van desde $0.15 por millón de tokens de entrada (M2.5) hasta $0.40 por millón (M1), lo que sitúa a MiniMax entre las API de clase frontera más económicas para código y trabajo con documentos largos. Casos de uso clave: pipelines de software de agentes, análisis de grandes bases de código, seguimiento de instrucciones de múltiples turnos y procesamiento masivo de contenido donde el costo por token es importante.

MiniMax de un vistazo, mayo de 2026

La línea actual de modelos de texto de MiniMax, del más antiguo al más reciente:

  • MiniMax-Text-01 / MiniMax-01 (enero de 2025): 456 mil millones de parámetros en total, 45.9 mil millones activados por token a través de un diseño Mixture-of-Experts. Introdujo el mecanismo de "lightning attention" que permite un contexto nativo de 1M de tokens y una extrapolación de inferencia de 4M de tokens. Los benchmarks en su lanzamiento igualaron a GPT-4o y Claude 3.5 Sonnet, ofreciendo al mismo tiempo una ventana de contexto 20-32 veces más larga. De código abierto en HuggingFace bajo Apache 2.0.

  • MiniMax-M1 (16 de junio de 2025): 456B de parámetros en total, modelo de razonamiento de atención híbrida, contexto de 1M, hasta 80K tokens de salida. Disponible en las variantes M1-40k y M1-80k. La ejecución completa del entrenamiento RL costó $534,700 en 512 GPU H800 durante tres semanas, utilizando el algoritmo de aprendizaje por refuerzo CISPO patentado por MiniMax. Puntuaciones en SWE-bench: 55.6% (40k) y 56.0% (80k).

  • MiniMax-M2 (23 de octubre de 2025): 230B de parámetros en total, 10B activos por inferencia a través de MoE. Ocupó el primer lugar entre todos los sistemas de pesos abiertos en el Artificial Analysis Intelligence Index en su lanzamiento. LiveCodeBench ~83%, SWE-bench verificado 69.4%. Contexto de 197K. Velocidad de salida de 114.5 tokens/segundo.

  • MiniMax-M2.1: Enfoque en programación multilingüe y multitarea. Ventana de contexto de 1M. Orientado a tareas de programación de múltiples pasos y cobertura de lenguajes empresariales.

  • MiniMax-M2.5: SWE-bench 70.40%, AIME 88.75%. El precio más bajo de la línea a $0.15/1M de tokens de entrada. Aproximadamente 16 veces más barato que las tarifas de entrada de Claude Opus 4.6 para tareas equivalentes.

  • MiniMax-M2.7 (18 de marzo de 2026): Buque insignia actual. SWE-Pro 56.22%, VIBE-Pro 55.6%, Terminal Bench 2 57.0%. GDPval-AA ELO de 1495, el más alto entre los modelos de código abierto en esa evaluación. Contexto de 205K.

  • MiniMax-M2-Her: Variante especializada para juegos de rol e interacción inmersiva con múltiples personajes. Contexto de 66K.

Las opciones de acceso incluyen HTTP directo, el SDK de OpenAI o el endpoint compatible con Anthropic de MiniMax (https://api.minimax.io/anthropic), lo que lo convierte en un reemplazo directo para bases de código ya construidas con herramientas de Anthropic.

En qué destaca realmente MiniMax

La serie M lidera o empata constantemente en el primer lugar entre los modelos de pesos abiertos en los benchmarks de ingeniería de software. En el lanzamiento de M1 en junio de 2025, lideró todos los modelos abiertos en TAU-bench (uso de herramientas de agentes), superando a Gemini 2.5 Pro y OpenAI o3 en tareas de contexto largo. El M2 y el M2.5 continuaron esa trayectoria, con el M2.5 alcanzando el 70.40% en SWE-bench verificado, igualando las puntuaciones de modelos que cuestan varias veces más por token.

El verdadero diferenciador es la combinación de contexto largo y bajo recuento de parámetros activos. MiniMax M1, con su ventana de 1M de tokens, procesa aproximadamente un 70% menos de recursos informáticos que DeepSeek R1 a 100K tokens, según las propias mediciones de MiniMax. Para los equipos que realizan análisis de grandes bases de código, revisión de documentos o bucles de agentes de horizonte largo, esas cifras son importantes.

"Integrar la serie MiniMax M2 en nuestra plataforma ha sido una gran victoria para nuestros usuarios. Hemos descubierto que M2.1 maneja los matices de las tareas de programación complejas y de múltiples pasos con un nivel de consistencia que es raro en este espacio." - equipo de plataforma de desarrolladores, citado en la cobertura del lanzamiento de MiniMax M2.1, enero de 2026

Los pesos abiertos son una ventaja real para los equipos que necesitan autoalojar o ajustar (fine-tune) los modelos. M1 y M2 están bajo licencia Apache 2.0, lo que permite su uso comercial y modificación. El artículo de MiniMax-01 (arXiv:2501.08313) proporciona detalles arquitectónicos completos, convirtiéndolo en uno de los lanzamientos de modelos de clase frontera más transparentes de cualquier laboratorio a nivel mundial.

"Estamos entusiasmados con los potentes modelos de código abierto como M2.1 que ofrecen un rendimiento de frontera y, en algunos casos, superan la frontera, para una amplia variedad de tareas de desarrollo de software. Los desarrolladores merecen tener opciones, y M2.1 proporciona esa opción tan necesaria." - desarrollador citado en la prensa del lanzamiento de MiniMax M2.1, enero de 2026

Dónde falla MiniMax: los problemas recurrentes de los usuarios

El sistema de límite de tasa (rate limit) es el punto de fricción citado con mayor frecuencia. MiniMax utiliza ventanas fijas de 5 horas en lugar de límites de tasa continuos. Si agotas tu asignación a las 9:45 a.m., debes esperar hasta las 10:00 a.m. para que se abra la siguiente ventana fija. Los desarrolladores acostumbrados a las ventanas continuas de OpenAI o Anthropic encuentran esto desorientador, y las ventanas fijas interactúan mal con las cargas de trabajo de agentes en ráfagas. Los usuarios que crearon cuentas después del 23 de marzo de 2026 también se enfrentan a límites de cuota semanales que los usuarios anteriores no tienen, creando niveles de acceso desiguales dentro del mismo producto.

Los modelos son verbosos. Artificial Analysis midió que M2 generó "70 millones de tokens de salida durante la evaluación, algo superior a la media", lo que se traduce directamente en costos de salida elevados en producción. Para tareas de resumen o clasificación con salidas cortas esperadas, la verbosidad puede inflar significativamente las facturas.

La inferencia local es poco práctica para la mayoría de los equipos. MiniMax-M1, con 456 mil millones de parámetros, requiere un hardware al que la mayoría de los desarrolladores no pueden acceder. Las discusiones de la comunidad en HuggingFace a finales de 2025 plantearon incertidumbre sobre la compatibilidad con llama.cpp. El M2 con 230B es más factible, pero sigue estando fuera de alcance sin un clúster.

Se aplican restricciones de contenido. Los requisitos regulatorios chinos (una ley de 2023 que prohíbe el contenido que "dañe la unidad nacional y la armonía social") significan que los modelos filtran temas políticos, particularmente aquellos relacionados con la gobernanza y los problemas territoriales de China. Para tareas generales de programación y escritura esto rara vez surge, pero es una limitación documentada que encontrarán los equipos de noticias, investigación de políticas o análisis geopolítico.

En el razonamiento matemático puro, MiniMax M2 se queda atrás de modelos de razonamiento más enfocados. AIME-25: MiniMax M2 con un 78% frente a Kimi K2 Thinking con un 94-99%. Si el caso de uso principal es la matemática paso a paso o la generación de pruebas formales, Kimi o Qwen3.5 son una mejor opción.

MiniMax vs. Qwen vs. DeepSeek

Los tres son importantes laboratorios chinos de pesos abiertos que lanzan modelos en rápida sucesión a lo largo de 2025-2026. Las diferencias son arquitectónicas y operativas, no solo de marketing.

MiniMax vs. Qwen (Alibaba): Ambos utilizan Mixture-of-Experts con activación dispersa. Qwen3.5 activa aproximadamente 37 mil millones de parámetros por pasada hacia adelante; MiniMax M2.7 activa 10 mil millones de un total de 230 mil millones, lo que hace que los costos de computación por token sean más bajos para MiniMax. La ventana de contexto de Qwen3.5 alcanza ~991K tokens, comparable al 1M de MiniMax M1. En programación competitiva, Qwen3.5 lidera (LiveCodeBench 85.33% vs. ~83% de MiniMax M2). En tareas intensivas en conocimiento, Qwen3.5 obtiene un 87.37% en GPQA Diamond. El precio de entrada del buque insignia es equivalente a $0.30/1M para ambos, aunque MiniMax M2.5 a $0.15 supera a las variantes más antiguas de Qwen. La elección entre ellos para la mayoría de las tareas de programación y análisis es realmente reñida; Qwen se adelanta en la recuperación de conocimientos y matemáticas competitivas, MiniMax se adelanta en la longitud del contexto y el uso puro de herramientas de agentes.

MiniMax vs. DeepSeek V3.2: La brecha mecánica es el rendimiento frente a la profundidad del contexto. DeepSeek V3.2 genera aproximadamente 230 tokens por segundo; MiniMax M2 genera 114.5. Si la velocidad es la restricción principal, DeepSeek es aproximadamente el doble de rápido. Cuando MiniMax M1 se lanzó en junio de 2025, su contexto de 1M de tokens era 8 veces mayor que la ventana de 128K de DeepSeek R1, una brecha arquitectónica concreta. Desde entonces, DeepSeek V3.2 ha ampliado el contexto, pero MiniMax M1 y MiniMax-01 siguen siendo los referentes para el manejo de entradas muy largas. El diseño del límite de tasa también difiere: DeepSeek utiliza ventanas continuas, MiniMax utiliza ventanas fijas de 5 horas. Los equipos con patrones de uso en ráfagas generalmente informan que el sistema de DeepSeek es más fácil de usar.

Para ser exhaustivos, Kimi K2 de Moonshot AI es el tercer competidor principal en este nivel. Kimi utiliza 1 billón de parámetros en total (32B activos), supera a MiniMax M2 en BrowseComp (60.2% vs. 44.0%) e iguala a Claude Opus 4.6 en matemáticas AIME. MiniMax supera a Kimi en precio ($0.30 vs. $0.60/1M de entrada para el buque insignia). También vale la pena comparar: Zhipu GLM y Llama como alternativas de pesos abiertos en diferentes puntos de capacidad y costo.

¿Vale la pena el nivel de API de pago?

A $0.15/1M de tokens de entrada (M2.5), MiniMax es aproximadamente 16 veces más barato que Claude Opus 4.6 para la entrada y aproximadamente el 8% del costo total de la API por token según análisis independientes. Para el procesamiento masivo, los pipelines de revisión de código o el análisis de documentos a escala, la economía es convincente.

La advertencia clave: MiniMax no ofrece un nivel de inferencia genuinamente gratuito de la forma en que lo hacen algunos servicios de alojamiento de código abierto. El Token Plan es un paquete masivo prepago; el Unlimited Monthly Plan existe para un uso empresarial intensivo. Para evaluación y creación de prototipos, OpenRouter aloja la mayoría de los modelos de MiniMax con acceso de pago por uso a partir de las tarifas por token enumeradas anteriormente, lo cual es la forma de menor fricción para probar antes de comprometerse con una cuenta directa en la plataforma.

La variante MiniMax M2.7-highspeed cuesta $0.60/1M de entrada, el doble de la tarifa estándar de M2.7. Los desarrolladores deben confirmar qué variante se invoca de forma predeterminada al utilizar integraciones de terceros, ya que la nomenclatura puede ser ambigua en la documentación de los wrappers de la API.

Los modelos de pesos abiertos bajo Apache 2.0 (M1, M2) pueden ser autoalojados por equipos con suficiente infraestructura, eliminando por completo los costos por token después de la implementación. Este es el camino más rentable para los usuarios a gran escala, pero requiere una capacidad de implementación de 230B-456B parámetros.

Mejores casos de uso (y cuándo evitarlo)

Ideal para:

  • Pipelines de ingeniería de software de agentes, automatización de CI/CD y generación de código de múltiples pasos. El rendimiento en TAU-bench respalda este caso de uso con datos verificables.

  • Análisis de documentos largos donde una ventana de contexto de 200K-1M de tokens elimina la necesidad de fragmentación. Bases de código completas, documentos legales, corpus de investigación.

  • Cargas de trabajo de producción sensibles a los costos donde los precios de Claude o GPT-4 son insostenibles y la calidad de respuesta en tareas de código debe mantenerse cerca de la frontera.

  • Casos de uso de autoalojamiento o ajuste fino donde se requiere la licencia Apache 2.0.

  • Equipos que ya están construyendo sobre el SDK de Anthropic y desean cambiar a un modelo más económico a nivel de endpoint sin realizar cambios en el código.

Evita MiniMax cuando:

  • Un rendimiento de salida superior a 150 tokens/segundo es un requisito estricto. DeepSeek V3.2 maneja mejor la inferencia de alta velocidad en ráfagas.

  • El caso de uso involucra temas políticos, geopolíticos o sensibles a la jurisdicción china donde es probable que el filtrado de contenido interfiera.

  • La tarea principal es la generación de pruebas matemáticas o matemáticas de competición. Kimi K2 Thinking y Qwen3.5 obtienen puntuaciones considerablemente más altas en AIME y en los benchmarks de razonamiento formal.

  • Los límites de tasa continuos y predecibles son un requisito. El diseño de ventana fija de 5 horas requiere rediseñar la lógica de reintento para los flujos de trabajo de agentes.

  • Se necesita inferencia local en hardware de consumo. Los recuentos de parámetros son demasiado grandes para todo lo que no sean clústeres de GPU empresariales.

Primeros pasos con MiniMax

El camino más rápido: crea una cuenta en platform.minimax.io, compra un paquete Token Plan y llama a la API a través del endpoint compatible con Anthropic (https://api.minimax.io/anthropic) utilizando tu código existente del SDK de Anthropic. Configura la URL base y la clave de API; la cadena del modelo se convierte en "MiniMax-M2.7" o "MiniMax-M2.5" dependiendo de tu objetivo de costo-rendimiento.

Para evaluación sin crear una cuenta, OpenRouter enumera MiniMax M2 y M2.7 como modelos de pago por uso accesibles con una clave de OpenRouter. Este es el primer paso recomendado antes de comprometerse con una cuenta en la plataforma MiniMax y un Token Plan.

Los modelos de pesos abiertos M1 y M2 están en HuggingFace bajo MiniMaxAI. Para el autoalojamiento, comienza con la variante M2 (230B en total, 10B activos) como un objetivo de implementación más manejable que el M1 de 456B. Tanto vLLM como SGLang han sido utilizados con éxito por la comunidad para servir inferencias.

Planificación del límite de tasa: asume ventanas fijas de 5 horas y construye un retroceso exponencial en consecuencia. El Coding Plan (basado en cuotas de prompts) y la facturación directa de créditos de API tienen diferentes economías para diferentes formas de carga de trabajo; los equipos que ejecutan bucles de agentes sostenidos generalmente prefieren la facturación de créditos para evitar el bloqueo de la ventana del plan.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Artículos relacionados

Guías y artículos relacionados con MiniMax (Modelos de texto).