Saltar al contenido principal
Vantaige
Whisper screenshot
Whisper logo

Whisper

Gratis

OpenAI Whisper es un modelo de reconocimiento de voz gratuito y con licencia MIT que transcribe audio en 99 idiomas. Los desarrolladores lo utilizan para flujos de trabajo de podcasts, notas de reuniones y subtítulos de vídeos. Se puede alojar de forma independiente sin coste alguno; también está disponible a través de la API de OpenAI por $0.006 por minuto.

Funciones:APIOpen Source

Whisper es un sistema de reconocimiento automático de voz (ASR) de código abierto creado y lanzado por OpenAI en septiembre de 2022. Entrenado con 680,000 horas de audio multilingüe recopilado de internet, abarca 99 idiomas y maneja una amplia gama de acentos, condiciones de grabación y vocabulario específico de dominio. Los pesos del modelo y el código de inferencia están publicados en GitHub bajo la licencia MIT, lo que significa que cualquiera puede descargar, modificar y usar Whisper sin pagar tarifas de licencia. OpenAI también ofrece Whisper a través de su API para los equipos que desean una inferencia alojada sin tener que gestionar su propia infraestructura de GPU.

A partir de abril de 2026, la versión recomendada para producción es Whisper large-v3-turbo, lanzada en octubre de 2024, que se ejecuta aproximadamente ocho veces más rápido que large-v3 con una precisión casi idéntica en idiomas con abundantes recursos. Los proyectos de la comunidad han ampliado lo que Whisper puede hacer: faster-whisper reempaqueta el modelo utilizando CTranslate2 para obtener mejoras de velocidad adicionales; WhisperX añade marcas de tiempo a nivel de palabra y diarización de hablantes; distil-whisper es una variante destilada entrenada en Hugging Face que es seis veces más rápida con un 49% menos de parámetros. Los desarrolladores utilizan Whisper en la producción de podcasts, transcripción de reuniones, subtitulación de vídeos, construcción de flujos de datos de voz y herramientas de accesibilidad.

Lo que Whisper produce en abril de 2026

Whisper genera transcripciones en texto sin formato con marcas de tiempo opcionales, disponibles como texto sin formato, SRT, VTT, TSV o JSON. La familia de modelos abarca cinco tamaños originales: tiny (39M de parámetros), base, small, medium y large (1.5B de parámetros). Los pesos recomendados actualmente para producción son large-v3-turbo, una variante destilada de large-v3 optimizada para el rendimiento sin requerir la huella de memoria completa de su predecesor.

El procesamiento se basa en fragmentos: Whisper analiza el audio en segmentos de 30 segundos. Esta arquitectura ofrece una alta precisión en audio grabado, pero significa que el modelo no puede transmitir transcripciones en tiempo real. Para flujos de trabajo por lotes, como el posprocesamiento de entrevistas, conferencias o llamadas grabadas, esto no es una limitación. Para la subtitulación en directo o los agentes de voz que necesitan respuestas en menos de un segundo, es una restricción estricta.

El soporte de idiomas abarca 99 idiomas. La calidad en esos idiomas no es uniforme. El inglés, español, francés, alemán, japonés y portugués tienen un rendimiento cercano al nivel humano en audios limpios. La cobertura disminuye significativamente para los idiomas con menos recursos. Los usuarios que transcriben yoruba, dialectos regionales del punjabi o criollo haitiano informan de tasas de error que requieren una corrección manual sustancial. La función de traducción convierte el audio de cualquier idioma compatible directamente a texto en inglés, lo que resulta útil para la indexación de contenido multilingüe.

El lanzamiento de large-v3-turbo en octubre de 2024 coincidió con un ciclo de noticias independiente: una investigación de Associated Press publicada el mismo mes documentó que Whisper alucinaba sistemáticamente texto en contextos de transcripción médica, generando oraciones que sonaban plausibles durante segmentos de audio silenciosos o ruido ambiental. La propia documentación de OpenAI ya incluía una advertencia de que el modelo "puede generar texto que no fue hablado", pero el informe de AP atrajo una mayor atención sobre esto y planteó dudas sobre las implementaciones de producción en entornos sanitarios y legales. El comportamiento de alucinación es arquitectónico, no depende del tamaño del modelo, y persiste en todas las variantes de Whisper, incluida turbo.

"Ejecuté Whisper en segmentos de audio silenciosos para probar y generó texto de relleno que sonaba plausible. No solo ruido, sino oraciones coherentes que nunca se pronunciaron. Este es un modo de fallo conocido y es alarmante para uso médico." - u/quietcompute, r/MachineLearning, enero de 2025

Dónde se sitúa Whisper frente a AssemblyAI Universal-3 y Deepgram Nova-3

La comparación honesta aquí es abierto frente a cerrado, y por lotes frente a tiempo real. Whisper es la única opción en esta comparación que se puede ejecutar sin conexión, ajustar con precisión e inspeccionar por completo. AssemblyAI y Deepgram son API comerciales cerradas.

AssemblyAI Universal-3 (lanzado en marzo de 2024) es un modelo codificador-decodificador propietario entrenado en conjuntos de datos de audio con licencia, que AssemblyAI afirma que son más limpios que el corpus de entrenamiento recopilado de internet de Whisper. La diferencia práctica: Universal-3 admite la transcripción en tiempo real a través de WebSocket con una latencia de extremo a extremo inferior a 300 ms, algo que la arquitectura de Whisper no puede igualar. Universal-3 también incluye diarización de hablantes integrada, eliminando la necesidad de ensamblar un flujo de trabajo independiente. En inglés conversacional, los puntos de referencia independientes respaldan en gran medida la afirmación de AssemblyAI de una tasa de error de palabras más baja que Whisper large-v3. Los precios comienzan con un nivel gratuito (cinco horas al mes) y luego pasan a $0.37 por hora. Whisper gana en amplitud de idiomas (99 frente a menos), coste cero de alojamiento propio, transparencia de código y ausencia de dependencia del proveedor.

Deepgram Nova-3 (lanzado en enero de 2025) utiliza una arquitectura de transmisión no autorregresiva, arquitectónicamente opuesta al diseño codificador-decodificador autorregresivo de Whisper. Esto permite a Nova-3 ofrecer transcripción en tiempo real con una latencia inferior a 200 ms y puntuaciones de confianza a nivel de palabra en tiempo real, lo que lo convierte en la opción de referencia para implementaciones de agentes de voz y subtitulación en directo. Nova-3 cubre 36 idiomas de forma nativa, menos que Whisper pero con mayor consistencia en esos idiomas. El precio de la API es de $0.0043 por minuto, más barato que la API de Whisper de OpenAI a $0.006 por minuto. Whisper vuelve a ganar en apertura, alojamiento propio y la gama completa de 99 idiomas.

La elección práctica suele reducirse a una pregunta: ¿necesita resultados en tiempo real? Si es así, Whisper no es viable sin soluciones complejas de fragmentación que aún introducen latencia. Si está procesando audio grabado por lotes, Whisper (alojado de forma independiente) ofrece una precisión competitiva o superior a un coste por minuto nulo a escala.

"whisper-large-v3-turbo es genuinamente impresionante. Estoy transcribiendo grabaciones de entrevistas de 4 horas y el WER es comparable a lo que le pagaba a Rev.com a $0.25/min. La mejora de velocidad sobre v3 es enorme." - u/mlpraktiker, r/MachineLearning, noviembre de 2024

La realidad de las licencias y los derechos de autor

La licencia MIT de Whisper es una de las más permisivas en IA: puede usarla comercialmente, redistribuirla, modificarla y crear productos sobre ella sin pagar regalías ni obtener permisos adicionales. La licencia cubre los pesos del modelo y el código de inferencia. No hay ninguna cláusula de "el uso comercial requiere un acuerdo empresarial" que incluyen algunos modelos abiertos.

La vía de alojamiento propio es totalmente gratuita. Descarga los pesos desde Hugging Face Hub, instala el paquete de Python y ejecuta la transcripción localmente. Los costes de la infraestructura de GPU son suyos, no de OpenAI. Un desarrollador que ejecuta large-v3-turbo en una GPU A10G alquilada a través de un proveedor en la nube paga la tarifa de la GPU, no una tarifa por transcripción. A escala, la economía es convincente: una productora de podcasts que procese 1,000 horas al mes pagaría aproximadamente $360 a las tarifas de la API de OpenAI, o una fracción de eso en computación de GPU ejecutando faster-whisper localmente.

La vía de la API de OpenAI cobra $0.006 por minuto de audio procesado. Esta es una tarifa estándar de pago por uso sin requisito de suscripción. Los equipos que desean una infraestructura gestionada sin poseer hardware de GPU utilizan esta ruta. No hay suscripción mensual ni precios por puesto. El punto de conexión de la API (`api.openai.com/v1/audio/transcriptions`) acepta archivos de audio de hasta 25MB y devuelve la transcripción en el formato solicitado.

Las bifurcaciones de la comunidad como faster-whisper y distil-whisper también tienen licencia MIT. WhisperX utiliza pyannote.audio para la diarización, y pyannote tiene su propio modelo de acceso en Hugging Face que requiere una cuenta antes de descargar ciertos modelos. Esto ha causado fricción en los equipos que intentan automatizar la configuración de su flujo de trabajo, ya que la restricción requiere un paso manual de solicitud de token.

Dónde Whisper se queda corto de manera constante

Alucinaciones en silencios y audios de baja señal. Esta es la limitación documentada más grave. Whisper genera texto que suena seguro durante segmentos que no contienen voz, ruido ambiental o audio inaudible. Los parámetros `no_speech_threshold` y `logprob_threshold` reducen este comportamiento pero no lo eliminan. Para los requisitos de precisión literal (médicos, legales, actas oficiales), cada segmento de salida necesita validación. Esta no es una preocupación teórica: la investigación de AP de octubre de 2024 documentó incidentes específicos en los que Whisper insertó palabras que nunca se pronunciaron en los resultados de transcripciones médicas.

Sin transmisión integrada. La arquitectura de fragmentos de 30 segundos de Whisper es una propiedad fija de cómo se entrenó el modelo. No puede producir transcripciones parciales a medida que llega el audio. Las soluciones de la comunidad implican la detección de actividad de voz (VAD) para dividir el audio en fragmentos a nivel de oración, pero estas añaden latencia y complejidad. Para agentes de voz, subtítulos de reuniones en directo o cualquier caso de uso en el que la salida deba aparecer dentro de los 500 ms posteriores a la voz, Whisper requiere una ingeniería significativa en torno a sus limitaciones principales.

La diarización de hablantes requiere ensamblaje de terceros. La salida de Whisper es una transcripción plana sin etiquetas de hablante. Añadir diarización requiere WhisperX más pyannote.audio, lo que implica una instalación separada, una cuenta de Hugging Face con acceso restringido al modelo y memoria de GPU adicional. Los equipos que provienen de API comerciales que incluyen la diarización como un simple interruptor encuentran que este trabajo de integración es significativo.

Requisitos de GPU para large-v3. Ejecutar large-v3 a una velocidad útil requiere como mínimo 10GB de VRAM en fp16. Las GPU de consumo como la RTX 3060 (12GB) sufren errores de falta de memoria con la configuración predeterminada. large-v3-turbo mejoró esto sustancialmente, pero los desarrolladores que desean la máxima precisión en large-v3 todavía necesitan un hardware potente. Los modelos small y medium se ejecutan de manera aceptable en CPU, pero producen resultados notablemente peores en audios difíciles.

Variación en la calidad del idioma. Whisper admite 99 idiomas, pero la distribución de la calidad es desigual. El modelo tiene un rendimiento cercano al nivel humano en inglés y en los principales idiomas europeos; el rendimiento en idiomas con menos recursos es lo suficientemente inconsistente como para que los usuarios que procesan yoruba, dialectos árabes regionales o idiomas asiáticos menos comunes describan con frecuencia que la salida requiere una revisión manual completa.

Para quién es Whisper

Whisper está diseñado específicamente para desarrolladores. No hay una interfaz de usuario web oficial, ni una interfaz de arrastrar y soltar, ni un panel de control gestionado por OpenAI. Para empezar se requiere Python, pip y una GPU compatible con CUDA o la paciencia para ejecutar modelos más pequeños en la CPU. Si eso describe su configuración, Whisper es una de las herramientas gratuitas más capaces disponibles para la transcripción a cualquier escala.

El caso de uso más sólido es el procesamiento por lotes sensible a los costes: producción de podcasts, generación de subtítulos de vídeo, archivo de conferencias grabadas, transcripción de audios de entrevistas para investigación, procesamiento de grabaciones de centros de llamadas. A 1,000 horas de audio al mes, una configuración de faster-whisper alojada de forma independiente solo cuesta la computación de la GPU. El mismo volumen a través de una API comercial cuesta $360 o más. La diferencia económica es abismal.

Whisper también se adapta a implementaciones sin conexión y aisladas (air-gapped). Los equipos de TI del sector sanitario, los contratistas gubernamentales y los bufetes de abogados que no pueden enviar audio a API externas pueden ejecutar Whisper completamente dentro de su propia infraestructura sin que ningún dato salga de su entorno. La licencia MIT significa que este uso está permitido sin restricciones.

Evite Whisper cuando: necesite transcripción en directo con una latencia inferior a 500 ms para agentes de voz o aplicaciones interactivas; cuando sus usuarios no sean técnicos y necesiten una interfaz web; cuando procese audio médico o legal donde el riesgo de alucinación sea inaceptable sin una capa de validación dedicada; o cuando necesite diarización de hablantes de nivel de producción lista para usar. En esos casos, AssemblyAI Universal-3 o Deepgram Nova-3 resuelven las carencias de tiempo real y diarización, a costa de la dependencia del proveedor y el precio por minuto.

Reseñas de usuarios

Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!

Inicia sesión para escribir una reseña.

Destacado en colecciones

Listas seleccionadas que incluyen Whisper.

Artículos relacionados

Guías y artículos relacionados con Whisper.