Saltar al contenido principal
Vantaige
Mochi 1 screenshot
Mochi 1 logo

Mochi 1

Gratis

Mochi 1 es el modelo de generación de video de código abierto de 10 mil millones de parámetros de Genmo, lanzado bajo la licencia Apache 2.0 en octubre de 2024. Genera clips en 480p a 30fps con una gran fidelidad a las indicaciones. Los pesos se pueden descargar gratis y ejecutar comercialmente sin pago de regalías.

Funciones:APIOpen Source

Mochi 1 es un modelo de texto a video de código abierto desarrollado por Genmo, una startup de IA de San Francisco respaldada por $28.4 millones en financiamiento de Serie A. Lanzado el 22 de octubre de 2024 bajo la licencia Apache 2.0, ofrece 10 mil millones de parámetros de capacidad de generación de video disponibles de forma gratuita tanto para uso personal como comercial, con los pesos alojados en Hugging Face y el código base completo en GitHub. En su lanzamiento, Genmo lo llamó "el modelo generativo de video más grande jamás lanzado en código abierto", y durante aproximadamente dos meses esa afirmación se mantuvo: ningún otro modelo abierto igualaba su combinación de escala, calidad de movimiento y licencias permisivas.

El modelo utiliza una arquitectura Asymmetric Diffusion Transformer (AsymmDiT) con 48 capas, una ventana de contexto visual de 44,520 tokens y un VAE de 362 millones de parámetros que comprime el video a un espacio latente 128 veces más pequeño. Las salidas son en 480p a 30 cuadros por segundo por hasta 5.4 segundos, impulsadas por un codificador de texto T5-XXL que produce una fuerte adherencia a las indicaciones en movimiento físico, comportamiento de la cámara y escenas con múltiples elementos. El lanzamiento bajo Apache 2.0 permite el ajuste fino, la adaptación LoRA (agregada en noviembre de 2024) y la implementación comercial sin dependencia de proveedores. Genmo también opera un entorno de pruebas web alojado en genmo.ai con una suscripción basada en créditos a partir de $10 por mes para equipos que no desean administrar su propia infraestructura de GPU.

Cómo se ven realmente los resultados de Mochi 1 en abril de 2026

Generamos un clip de 5 segundos de una gota de agua en cámara lenta golpeando la superficie de un estanque tranquilo utilizando el entorno alojado genmo.ai en abril de 2026. La propagación de las ondas fue físicamente verosímil durante toda la duración del clip, sin artefactos de deformación en el borde del agua. El resultado en 480p mantuvo suficiente detalle para una línea de tiempo en 1080p aplicando escalado en posproducción, aunque la compresión visible se hizo evidente en la versión escalada al inspeccionarla de cerca. La velocidad de fotogramas a 30fps se sintió fluida para material de origen en cámara lenta, aunque el límite estricto de 5.4 segundos cortó la fase de asentamiento natural de la secuencia de ondas.

A partir de abril de 2026, el modelo lanzado públicamente todavía produce video en 480p a 30fps para clips de hasta 5.4 segundos. Genmo prometió una variante Mochi 1 HD orientada a 720p antes de finales de 2024; ese plazo se retrasó, y un problema en GitHub de febrero de 2025 solicitando claridad sobre el lanzamiento en HD quedó sin respuesta por parte del equipo. La tarjeta oficial del modelo indica que el modelo "se optimiza para estilos fotorrealistas" y que "también pueden ocurrir deformaciones y distorsiones menores" en casos de movimiento extremo. El modelo ha acumulado más de 100 Spaces en Hugging Face, 5 adaptadores, 6 ajustes finos y 4 cuantizaciones de la comunidad, lo que refleja un uso activo sostenido a pesar de sus limitaciones técnicas.

"Hay una curva de aprendizaje, pero una vez que elaboras buenas indicaciones, se siente como dirigir un corto de Pixar". - Revisor de G2, vía Geniusfirms.com, 2025

Mejores casos de uso y los desastres a evitar

Mochi 1 se gana su lugar en flujos de trabajo donde la licencia Apache 2.0 es importante, la calidad fotorrealista es la prioridad y los equipos tienen su propia infraestructura de GPU o un presupuesto de alojamiento modesto. Los cineastas independientes que exploran la visualización de escenas asistida por IA, los equipos de marketing que crean demostraciones cortas de productos y los investigadores de ML que necesitan realizar ajustes finos en conjuntos de datos visuales patentados tienen razones legítimas para elegir Mochi 1 sobre las alternativas.

La capacidad de ajuste fino de LoRA agregada en noviembre de 2024 es particularmente valiosa para casos de uso de consistencia de marca. Un equipo puede entrenar a Mochi en un conjunto de referencias visuales aprobadas y luego generar clips de video acordes a la marca en todas las campañas sin tener que volver a crear indicaciones desde cero. Las herramientas de código cerrado de Runway, Pika o Kling no permiten este flujo de trabajo. En la plataforma alojada, el nivel Lite de $10/mes, que cubre aproximadamente 12 generaciones de video mensuales, se adapta a los creadores independientes que crean contenido social fotorrealista sin configurar una infraestructura de GPU local.

Los desastres: si se le indica a Mochi que genere anime, dibujos animados, sombreado plano o estilos pictóricos, los resultados son deficientes. El modelo fue entrenado con imágenes fotorrealistas y no tiene un mecanismo confiable para la transferencia de estilo estético. Si se intenta una secuencia de acción de movimiento rápido, aparecen artefactos de deformación en los bordes. Si se intenta ejecutar en una GPU de 12GB, las versiones cuantizadas producen una degradación de calidad notable. Si se usa para la iteración rápida de conceptos a través de muchas variaciones de indicaciones, el tiempo de generación de 8 a 20 minutos por clip se convierte rápidamente en un cuello de botella creativo.

Control de movimiento y cámara, qué tan bien se mantiene

El control de movimiento es una de las capacidades demostradas más fuertes de Mochi 1. La ventana de contexto visual de 44,520 tokens del AsymmDiT aplica atención 3D completa en toda la secuencia de video, lo que Genmo atribuye a la coherencia cuadro por cuadro del modelo. En la práctica, esto se muestra más claramente en el movimiento impulsado por la física: la dinámica de fluidos, el movimiento del cabello, la simulación de telas y los gestos humanos lentos mantienen la consistencia espacial mejor que los modelos abiertos anteriores.

El control de la cámara se expresa principalmente a través del lenguaje de las indicaciones. Describir las direcciones de panorámica, las velocidades de zoom, los ángulos de inclinación y los movimientos de seguimiento en la indicación de texto produce resultados que se alinean con esas instrucciones de manera más confiable que muchos modelos comparables. La interfaz alojada en genmo.ai también expone controles de intensidad de movimiento que van desde estables (alrededor del 50%) hasta altamente dinámicos (hasta el 99%), brindando a los usuarios no técnicos un enfoque basado en controles deslizantes para el comportamiento del movimiento sin ingeniería de indicaciones. Lo que el modelo no admite de forma nativa es la conversión de imagen a video con una ruta de cámara estructurada, lo que limita su uso en flujos de trabajo de composición cinematográfica controlada.

El movimiento extremo es donde el control se degrada. Las panorámicas rápidas de la cámara, el movimiento rápido de objetos y las secuencias de movimiento de alta frecuencia empujan al modelo hacia artefactos de deformación en los límites de los objetos. La tarjeta oficial del modelo lo reconoce explícitamente. El consenso entre los usuarios del flujo de trabajo de ComfyUI es que mantener la intensidad del movimiento por debajo del 80% produce resultados más limpios para la mayoría de los tipos de sujetos.

"El modelo requiere una longitud de secuencia de 44,520 tokens para la generación de video, lo que consume memoria, y el VAE es un devorador masivo de memoria. Buenas noticias: los requisitos se han reducido, por lo que ahora es posible en una sola RTX 4090". - ved-genmo (miembro del equipo de Genmo), hilo de discusión de Hugging Face, 1 de noviembre de 2024

Límites de exportación: resolución, duración, marcas de agua

Los pesos de código abierto producen video en 480p (848x480) a 30fps, con un límite de 5.4 segundos (162 fotogramas). No hay marca de agua nativa en las salidas generadas localmente; Apache 2.0 permite la exportación sin restricciones. Los flujos de trabajo de escalado de la comunidad que utilizan Real-ESRGAN o herramientas similares pueden llevar la resolución efectiva a 1080p, aunque el 480p escalado no es equivalente al 720p nativo, particularmente en los detalles faciales y la textura fina a distancias de visualización cercanas.

En la plataforma alojada genmo.ai, el nivel gratuito aplica una marca de agua de Genmo a todas las salidas. Los niveles de pago (Lite a $10/mes y Standard a $30/mes) eliminan la marca de agua y otorgan derechos de uso comercial sobre los clips generados en la plataforma. No hay opción para exportar más de 5.4 segundos desde una sola generación; las secuencias más largas requieren unir múltiples clips en posproducción. La plataforma alojada exporta archivos MP4; la relación de aspecto se establece antes de que comience la generación con opciones de 16:9, 9:16 y 1:1 disponibles para el formato de redes sociales.

Un flujo de trabajo real: animación de productos de marca con Mochi 1

Un flujo de trabajo típico de animación de productos de comercio electrónico utilizando Mochi 1 en la plataforma alojada funciona de la siguiente manera. Un creador sube una foto fija del producto (un frasco de fragancia, por ejemplo), usa la herramienta de pincel selectivo en genmo.ai para marcar la región interior del líquido como el área a animar, luego agrega una indicación de texto que describe un movimiento de remolino suave con iluminación ambiental tenue. La generación toma de 2 a 5 minutos en la cola alojada. El resultado es un MP4 de 5 segundos en 480p que muestra el líquido moviéndose dentro de la botella mientras el vidrio y la etiqueta permanecen estáticos. El creador descarga, aplica el escalado de Real-ESRGAN para alcanzar 1080p, agrega una pista de música en un editor separado y lo publica en Instagram Reels. Tiempo total desde la carga hasta el clip publicado: aproximadamente 15-20 minutos. Costo en el nivel Lite: aproximadamente 83 centavos por generación de video (100 créditos a $10/1,200 créditos).

Para una variante de investigación autoalojada, un equipo de ML podría ajustar Mochi a través de LoRA en 500 clips de metraje de marca aprobados, produciendo un modelo adaptado al dominio que genera consistentemente imágenes acordes a la marca sin volver a indicar descripciones de estilo. Este flujo de trabajo requiere infraestructura de GPU (una RTX 3090 o superior para inferencia, un clúster de GPU de gama alta para el entrenamiento de LoRA) pero no cuesta nada en tarifas de licencia y produce resultados en los que Genmo no tiene visibilidad.

El costo real por video terminado

Autoalojado: solo computación. Ejecutar una RTX 4090 de 8 a 20 minutos por generación en una plataforma de alquiler en la nube a aproximadamente 80 centavos por hora sitúa el costo entre 10 y 30 centavos por clip. Un equipo con infraestructura de GPU propia paga solo la electricidad, acercándose a un costo marginal cero por video. Los servicios de GPU en la nube como RunPod y Lambda Labs ofrecen acceso a A100 a aproximadamente $1.50-$2.50 por hora, lo que sitúa una generación típica de Mochi entre 20 y 80 centavos dependiendo de la complejidad del clip.

Alojado a través de genmo.ai: cada generación de video de Mochi cuesta 100 créditos. Los niveles se desglosan de la siguiente manera:

  • Gratis (Alojado): $0/mes, 50 créditos/mes, marca de agua de Genmo, solo para uso personal. Cubre aproximadamente 0-1 generaciones de video de Mochi por mes después de que se agota el bono de registro inicial.

  • Lite (Alojado): $10/mes, 1,200 créditos/mes (aproximadamente 12 generaciones de Mochi), sin marca de agua, uso comercial, alta prioridad en la cola. La facturación anual reduce la tarifa en un 20%.

  • Standard (Alojado): $30/mes, 5,000 créditos/mes (aproximadamente 50 generaciones de Mochi), sin marca de agua, la cola más rápida, acceso anticipado a modelos. La facturación anual reduce la tarifa en un 20%.

Los precios de la API de Replicate para Mochi 1 rondan aproximadamente los $0.42 por generación (aproximadamente 2 ejecuciones por $1), lo que lo convierte en una opción viable para los desarrolladores que necesitan inferencia alojada sin un compromiso de suscripción.

Mochi 1 vs. HunyuanVideo vs. LTX-Video

HunyuanVideo (Tencent, diciembre de 2024) utiliza 13 mil millones de parámetros frente a los 10 mil millones de Mochi, construido sobre una arquitectura Mixture-of-Experts con módulos de guía de texto entre fotogramas en lugar del AsymmDiT de Mochi. La diferencia de resolución de salida es el cambio más visible: HunyuanVideo genera 1280x720 de forma nativa frente a los 848x480 de Mochi. En el punto de referencia VBench, HunyuanVideo obtiene una puntuación de 83.2 frente a los 77.4 de Mochi, con ventajas en calidad cinematográfica, fidelidad facial en múltiples personajes y coherencia de movimiento en duraciones más largas. La compensación es la velocidad: HunyuanVideo tarda aproximadamente 45 minutos en generar un clip de 5 segundos en una A100, frente a los 8 minutos de Mochi. HunyuanVideo utiliza una licencia personalizada con condiciones comerciales; Mochi 1 es Apache 2.0 sin restricciones. Para proyectos donde la calidad es lo primero y el tiempo de generación es secundario, HunyuanVideo es el líder actual de código abierto. Para mayor claridad en las licencias o una iteración más rápida, Mochi 1 es más práctico.

LTX-Video (Lightricks) hace el intercambio opuesto. Su modelo base utiliza 2 mil millones de parámetros (con una variante de desarrollo de 13B también disponible) y utiliza atención factorizada, procesando dimensiones espaciales y temporales de forma independiente en lugar de la atención 3D completa de Mochi a través de 44,520 tokens. El resultado: LTX-Video genera un clip de 5 segundos en aproximadamente 45 segundos en una A100 frente a los 8 minutos de Mochi, y se ejecuta en 8GB de VRAM frente al mínimo de 17-18GB de Mochi. La resolución de salida alcanza 1216x704. Su puntuación en VBench es de 71.2, por debajo de los 77.4 de Mochi, lo que refleja la compensación de calidad realizada para lograr velocidad. LTX-Video utiliza una licencia personalizada, no Apache 2.0. Para la iteración rápida de conceptos a través de muchas variaciones de indicaciones, LTX-Video es la opción predeterminada práctica. Para una calidad fotorrealista sostenida bajo una licencia comercial limpia, Mochi 1 se defiende muy bien.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Mochi 1.

Artículos relacionados

Guías y artículos relacionados con Mochi 1.