Saltar al contenido principal
Vantaige
Veo 3 screenshot
Veo 3 logo

Veo 3

Freemium

Veo 3 es el modelo de generación de video de Google DeepMind y la primera gran IA comercial en producir audio sincronizado junto con el video en una sola pasada. Disponible a través de la aplicación Gemini en iOS y Android, Google Flow y Vertex AI para acceso API empresarial.

Funciones:APIMobile App

Veo 3 es el modelo de generación de video de Google DeepMind, lanzado en Google I/O el 20 de mayo de 2025. Es el primer gran generador de video por IA comercial que produce audio sincronizado, incluyendo diálogos, efectos de sonido ambiental y música, de forma nativa junto con el video en una sola pasada de generación. Antes de Veo 3, todas las principales herramientas de video por IA, incluyendo Sora, Runway, Pika y Kling, producían clips silenciosos por defecto, lo que requería buscar y superponer el audio por separado en la posproducción. Veo 3 puso fin a ese flujo de trabajo. Funciona a través de la aplicación Gemini en iOS y Android, Google Flow (la herramienta dedicada a la creación cinematográfica), Google AI Studio y Vertex AI para acceso API empresarial.

El modelo genera videos en 1080p de hasta 8 segundos por clip con movimiento consciente de la física y controles de cámara que incluyen zoom, paneo y tomas de seguimiento. Su sistema de audio crea resultados adaptados al contexto: olas del mar, ruido ambiental de la calle, diálogos de personajes con movimiento de boca sincronizado con los labios, y música de fondo elegida por el modelo a partir del contexto de la escena. Veo 3.1 (octubre de 2025) amplió la arquitectura con escalado a 4K, video vertical 9:16 para Shorts y TikTok, y la tecnología Scene Extension que encadena clips en narrativas continuas que superan los 60 segundos. El acceso a Vertex AI ofrece facturación por segundo para integraciones de desarrolladores, con marcas de agua invisibles de SynthID aplicadas a todos los resultados para el seguimiento de la procedencia del contenido.

Qué produce Veo 3 en abril de 2026

A partir de abril de 2026, tres modelos de la generación Veo 3 están en uso activo. El Veo 3 original (mayo de 2025) genera clips de 8 segundos a 1080p con audio nativo. Veo 3.1 (octubre de 2025) añade escalado a 4K, composición vertical y Scene Extension para narrativas más largas. Veo 4 se lanzó en abril de 2026 con generación de un solo clip de 30 segundos, creación de guiones gráficos (storyboarding), consistencia de personajes mejorada y creación de avatares zero-shot, disponible en Gemini Ultra y Google Flow.

El sistema de audio es la característica técnica definitoria. Veo 3 utiliza una arquitectura de difusión conjunta de video y audio en lugar de un modelo de audio separado superpuesto. Cuando se solicita una escena de playa, el modelo genera sonidos de olas coincidentes. Cuando se solicita un personaje hablando un diálogo, genera la voz con una inflexión natural e intenta sincronizar los labios. El modelo toma decisiones de audio contextuales: en las pruebas, cuando una escena podía tener ruido ambiental o música de fondo, seleccionaba lo que mejor se adaptaba al contenido. El tiempo de generación oscila entre 2 y 10 minutos dependiendo de la complejidad y la carga del servidor, con una variante más rápida ("Fast") disponible para la creación de prototipos con resolución y fidelidad de audio reducidas.

El acceso requiere una suscripción de pago. El acceso para consumidores se realiza a través de Google AI Pro ($19.99/mes) y Google AI Ultra ($249.99/mes) en la aplicación Gemini. El acceso para desarrolladores se realiza a través de la API de Gemini o Vertex AI a aproximadamente $0.40-0.75 por segundo de video generado, dependiendo del nivel de calidad y de si se incluye audio. Las cuentas de Google Cloud comienzan con $300 en créditos aplicables a las llamadas a la API de Veo.

Dónde se sitúa Veo 3 frente a Sora 2 y Runway Gen-4

Las tres plataformas comerciales dominantes de generación de video difieren en su arquitectura de formas que afectan directamente a los flujos de trabajo creativos.

Veo 3 frente a Sora 2 (OpenAI): Sora utiliza un autoencoder espaciotemporal combinado con un Transformer de Difusión (DiT) que representa el video como parches de espacio-tiempo con codificación posicional 3D. Su Transformer de Difusión Multimodal (MM-DiT) procesa entradas de texto, imagen y audio a través de flujos separados. La diferencia mecánica crítica: la arquitectura de Sora separa el audio por completo de la generación de video. Sora no produce audio nativo. Los clips salen en silencio; el sonido debe añadirse mediante herramientas de posproducción. La coherencia temporal de Sora y la semántica de los prompts para el movimiento de cámara cinematográfico son ampliamente reconocidas como superiores, lo que lo hace preferible para secuencias narrativas más largas. Pero para los creadores de contenido que necesitan un resultado audiovisual completo sin un paso de posproducción, el silencio de Sora es un obstáculo en el flujo de trabajo.

"Solo por el audio de Veo 3.1 ya vale la pena. Los videos de Sora son hermosos pero silenciosos: inútiles para la mayoría del contenido". - Comentarista de Reddit, r/AIVideoGeneration, finales de 2025

Veo 3 frente a Runway Gen-4 / Gen-4.5: Runway Gen-4 (marzo de 2025) se lanzó sin audio nativo, en consonancia con todos los modelos anteriores de Runway. La arquitectura es un transformer de difusión con atención temporal a través de los fotogramas, diseñado específicamente para resultados cinematográficos profesionales: fuerte consistencia de personajes, controles de cámara sofisticados y una profunda integración en los flujos de trabajo de posproducción. Runway Gen-4.5 (diciembre de 2025) añadió la generación de audio nativo, 7 meses después de Veo 3. El híbrido Autoregresivo a Difusión (A2D) en Gen-4.5 combina la calidad visual de la difusión con la comprensión de escenas autoregresiva. El modelo de precios de Runway (niveles de suscripción de $12 a $144/mes por volumen de créditos) se adapta a los profesionales creativos de alta iteración. Su calidad de salida cinematográfica y la consistencia de los personajes siguen siendo el estándar de la industria para uso en producción. La ventaja de Veo 3 es la entrega prioritaria de audio y una mayor accesibilidad para el consumidor a través del ecosistema de suscripciones existente de Google.

El costo real de generar video con Veo 3

El costo depende completamente de la vía de acceso. Vía para consumidores: Google AI Pro a $19.99/mes incluye acceso a Veo 3/3.1 dentro de las cuotas de generación. Los usuarios del nivel Pro informan que alcanzan los límites diarios después de un pequeño número de videos, y algunas cuentas se bloquean durante 24 horas después de 5 a 10 generaciones, dependiendo de la configuración. Google AI Ultra a $249.99/mes proporciona la mayor asignación.

Vía API en Vertex AI: aproximadamente $0.75 por segundo de video con audio en el nivel estándar de Veo 3. Un clip de 8 segundos cuesta aproximadamente $6. Un minuto de metraje cuesta aproximadamente $360 a la tarifa estándar. Veo 3.1 Fast reduce esto a aproximadamente $0.15/segundo, convirtiéndolo en el nivel práctico para flujos de trabajo con muchas iteraciones. El problema económico clave: los créditos se consumen en el momento de la generación, independientemente de la calidad del resultado. Un video silencioso, un resultado con voz ininteligible o un clip con superposiciones de subtítulos no deseados cuestan lo mismo que una toma perfecta.

"De hecho, pensé que había aparecido un anuncio aleatorio en mi pantalla. Se veía así de realista". - Revisor de Manus.im, probando Veo 3, 2025

Los usuarios empresariales por volumen en Vertex AI pueden negociar tarifas personalizadas, con reducciones reportadas del 20 al 40% a escala. Klarna, Kraft Heinz y Japan Airlines (a través de la agencia asociada Jellyfish/Pencil) fueron citados en el anuncio de lanzamiento de Vertex AI de Google como los primeros usuarios empresariales. Kraft Heinz informó haber reducido los plazos creativos de 8 semanas a 8 horas utilizando Veo a través de Vertex AI.

Dónde falla Veo 3 de manera constante

Seis modos de fallo recurrentes aparecen en reseñas y discusiones de foros con la suficiente consistencia como para esperarlos en lugar de sorprenderse:

  • Alucinación de subtítulos ininteligibles: Desde su lanzamiento hasta al menos julio de 2025, Veo 3 añadió superposiciones de subtítulos sin sentido a las escenas de diálogo, incluso cuando se le indicó explícitamente que no lo hiciera. Google anunció una solución el 9 de junio de 2025. MIT Technology Review informó que el problema persistía el 15 de julio de 2025. La directora creativa Mona Weiss afirmó: "Si estás creando una escena con diálogo, hasta el 40% de su resultado tiene subtítulos incomprensibles que lo hacen inutilizable". La causa principal es el entrenamiento con contenido de YouTube y TikTok con subtítulos incrustados; los prompts negativos son menos efectivos que las instrucciones positivas para suprimir patrones aprendidos.

  • Límite estricto de 8 segundos por clip: La frustración más común. El contenido social y los anuncios requieren con frecuencia segmentos de 15 a 20 segundos. Scene Extension en Veo 3.1 ayuda, pero requiere que los clips individuales se encadenen, con gestión de las uniones y la consistencia.

  • Desajuste entre el audio y el prompt: A veces, el modelo genera elementos de audio no solicitados, añade diálogos que no se pidieron o produce un habla ininteligible. La inteligencia de audio puede excederse.

  • Desviación del prompt en escenas complejas: Las escenas con múltiples elementos que tienen 3 o más objetos o comportamientos distintos con frecuencia tergiversan partes del prompt. Las secuencias de acción producen multitudes estáticas y comportamientos genéricos en lugar de los especificados.

  • Falsos positivos en la política de contenido: Los usuarios informan que prompts creativos legítimos son marcados por violaciones de la política, lo que requiere un reenvío y la pérdida de créditos.

  • Lentitud de renderizado y límites de generación: La generación puede tardar más de 10 minutos bajo carga. Los límites de generación diaria varían según el nivel de suscripción y no siempre se publican claramente, lo que provoca bloqueos inesperados a mitad del proyecto.

Vale la pena destacar por separado el incidente de moderación de contenido de julio de 2025 para los usuarios empresariales. Media Matters for America informó el 1 de julio de 2025 que videos racistas y antisemitas generados con Veo 3 se estaban subiendo y volviendo virales en TikTok, y algunos clips alcanzaron más de 1 millón de visitas. La incapacidad del modelo para entender los tropos racistas dificultó la moderación del contenido. TikTok prohibió las cuentas marcadas. El incidente puso de relieve la brecha entre los filtros de seguridad por video y el uso indebido sistémico a escala, y llevó a Google a endurecer las restricciones de generación.

Mejores casos de uso frente a escenarios a evitar

Ideal para:

  • Contenido social de formato corto donde importa la entrega con audio completo. Los creadores de YouTube Shorts, TikTok e Instagram Reels obtienen un recurso completo de video y audio en una sola generación, eliminando por completo el paso de búsqueda y sincronización de audio.

  • Material de archivo (B-roll) de marketing y animaciones sociales. El caso empresarial está bien documentado: iteración rápida desde el briefing hasta el entregable para contenido de marca, animaciones sociales y cortinillas de productos.

  • Contenido de estilo documental y de entrevistas. La generación de diálogos de bustos parlantes es un punto fuerte específico, con una inflexión natural del habla y una captura de expresiones faciales que funcionan bien en pruebas con sujetos controlados.

  • Desarrolladores que integran la generación de video a través de API. La facturación por segundo de Vertex AI es predecible; la integración de la API de Gemini es sencilla para los equipos que ya están en el ecosistema de Google Cloud.

Evita Veo 3 cuando:

  • Necesites coherencia narrativa de formato largo a lo largo de más de 30 segundos de una sola escena continua. Sora 2 maneja esto mejor en su lanzamiento; Veo 4 lo aborda en parte, pero Veo 3 no es la herramienta adecuada para la narración visual de formato largo.

  • Necesites una consistencia determinista de los personajes en múltiples tomas o escenas. Runway Gen-4 está diseñado específicamente para este caso de uso de producción.

  • Tu flujo de trabajo requiera un alto volumen de iteración a bajo costo. A $6 por clip de 8 segundos con audio, la iteración intensa se vuelve costosa rápidamente. Los límites de generación del nivel de consumidor agravan esto.

  • Estés fuera del ecosistema de Google y necesites flexibilidad de flujo de trabajo con múltiples proveedores. Runway y Sora tienen integraciones de terceros más amplias.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Veo 3.

Artículos relacionados

Guías y artículos relacionados con Veo 3.