

Milvus es una base de datos vectorial de código abierto y nativa de la nube, diseñada para búsquedas de similitud a escala de miles de millones. Respaldada por Zilliz y utilizada en producción por NVIDIA, Salesforce y eBay. Alojamiento propio gratuito. El servicio gestionado Zilliz Cloud comienza con un plan gratuito y niveles de pago desde $99/mes.
Milvus es una base de datos vectorial de código abierto diseñada para búsquedas de similitud de alto rendimiento a gran escala, desde millones de vectores en una sola máquina hasta miles de millones de vectores distribuidos en un clúster. Creada por Zilliz y donada a la LF AI & Data Foundation en 2020, se distribuye bajo la licencia Apache 2.0 y es desarrollada por un equipo de ingeniería a tiempo completo con contribuciones de más de 200 desarrolladores de código abierto en todo el mundo. Más de 10,000 organizaciones empresariales ejecutan Milvus en producción, incluyendo NVIDIA, Salesforce, eBay, Airbnb y DoorDash. A partir de abril de 2026, la versión estable actual es Milvus 2.6.x.
Su capacidad principal es la búsqueda de vecinos más cercanos aproximados (ANN) sobre embeddings vectoriales de alta dimensión, con soporte para más de 11 tipos de índices, incluyendo HNSW, IVF_FLAT, DiskANN, SCANN y CAGRA acelerado por GPU a través de la biblioteca cuVS de NVIDIA. Milvus 2.5 (diciembre de 2024) añadió búsqueda de texto completo nativa utilizando Sparse-BM25, lo que permite consultas híbridas de vectores y palabras clave en un solo motor sin necesidad de una implementación separada de Elasticsearch. Milvus 2.6 (junio de 2025) introdujo Woodpecker, un registro de escritura anticipada (WAL) nativo de la nube que elimina la dependencia externa de Kafka/Pulsar, además de almacenamiento por niveles (caliente/frío) para una reducción de hasta el 50% en los costos de almacenamiento. Zilliz también opera Zilliz Cloud, un servicio de Milvus totalmente gestionado con un nivel gratuito, pago por uso sin servidor (serverless) y clústeres dedicados a partir de $99/mes.
Lo que Milvus realmente hace en abril de 2026
Milvus ejecuta búsquedas de similitud vectorial en conjuntos de datos que colapsarían otras herramientas. El proyecto ha pasado por dos grandes reconstrucciones arquitectónicas: la línea monolítica original 1.x y la arquitectura 2.x nativa de la nube y totalmente desagregada que se distribuye hoy en día. El diseño 2.x separa el almacenamiento, la computación y la coordinación en capas independientes, por lo que puedes escalar los nodos de consulta por separado de los nodos de ingesta de datos según la forma real de la carga de trabajo.
El soporte de índices es el más amplio entre las bases de datos vectoriales de código abierto. Más allá de HNSW, obtienes variantes IVF para implementaciones con memoria limitada, DiskANN para índices a escala de miles de millones en disco, SCANN para escenarios de alta recuperación (recall) y cuatro tipos de índices acelerados por GPU a través de NVIDIA cuVS. El índice CAGRA por GPU ofrece un rendimiento aproximadamente 10 veces mayor en cargas de trabajo de búsqueda por lotes en comparación con HNSW solo por CPU a niveles de recuperación comparables. Para los equipos con infraestructura de GPU de NVIDIA, esta no es una mejora marginal.
La integración de búsqueda de texto completo de Milvus 2.5 es la adición arquitectónica más significativa en las versiones recientes. Antes de la 2.5, un patrón de producción común era ejecutar Milvus junto a Elasticsearch (Milvus para búsqueda semántica, Elasticsearch para coincidencia de palabras clave) y fusionar los resultados en la capa de aplicación. Milvus 2.5 reemplazó esto con Sparse-BM25 integrado, impulsado por la indexación de Tantivy. El benchmark que Zilliz publicó en el lanzamiento mostró que Milvus 2.5 devolvía resultados en 6 milisegundos frente a los 200 milisegundos de Elasticsearch en 1 millón de vectores, una mejora de 30 veces. Los equipos que se actualizaron eliminaron un clúster entero de su infraestructura.
Milvus 2.6 abordó el problema de la dependencia de infraestructura desde un ángulo diferente. El nuevo sistema Woodpecker WAL elimina los requisitos externos de Kafka o Pulsar al persistir los datos de registro directamente en el almacenamiento de objetos (S3, GCS, MinIO). Woodpecker alcanza un rendimiento de 450 MB/s en modo de sistema de archivos local, 3.5 veces más rápido que Kafka, y 750 MB/s contra S3, 5.8 veces más rápido que Kafka. Esta simplificación es de suma importancia para los equipos con alojamiento propio que antes tenían que operar y monitorear un clúster de Kafka además de etcd y el almacenamiento de objetos.
"Los equipos dependen de Milvus en entornos exigentes donde el rendimiento, la fiabilidad y el costo son importantes. A medida que crezca la adopción, seguiremos escuchando atentamente a la comunidad y convirtiendo esa confianza en una plataforma que escale para la producción empresarial." - James Luan, vicepresidente de ingeniería en Zilliz, diciembre de 2025
Dónde se sitúa Milvus frente a Qdrant y Pinecone
Estos tres cubren el principal espacio de decisión para las bases de datos vectoriales en producción, y difieren mecánicamente en aspectos que importan para las opciones de implementación.
Qdrant está escrito en Rust y se distribuye como un único binario sin dependencias externas para implementaciones independientes. Su índice ANN principal es solo HNSW: un algoritmo, bien ajustado, con un rico filtrado de metadatos incorporado. Los benchmarks en vectores SQuAD de 384 dimensiones muestran una latencia de consulta de Qdrant de 94 ms frente a los 250 ms de Milvus (Qdrant gana en latencia por consulta), pero Milvus alcanza aproximadamente 46 QPS frente a los 4.7 QPS de Qdrant (Milvus gana en rendimiento por unas 10 veces). Qdrant es la mejor opción para cargas de trabajo de menos de 100 millones de vectores donde la latencia de un solo dígito en milisegundos importa más que el rendimiento agregado. Milvus toma la delantera cuando tus volúmenes de ingesta, concurrencia de consultas o recuento total de vectores requieren un escalado horizontal: la agrupación horizontal de Qdrant es más simple que la de Milvus, pero no está diseñada para los mismos volúmenes de datos. Qdrant tampoco tiene soporte de aceleración por GPU. Milvus soporta NVIDIA CAGRA para obtener ganancias de rendimiento de 10x en hardware compatible.
Pinecone es totalmente propietario y de código cerrado, sin opción de alojamiento propio. Solo se utiliza a través de su servicio en la nube gestionado. Pinecone abstrae la capa de indexación por completo: no puedes elegir el tipo de índice, ajustar los parámetros de HNSW ni acceder a los componentes internos de almacenamiento. Para los equipos sin un mandato de infraestructura, esto es una ventaja: Pinecone llega a producción en una tarde. Para los equipos que necesitan portabilidad de datos, acceso a auditorías o ajuste de latencia-recuperación para cargas de trabajo específicas, la abstracción se convierte en un límite. Los precios divergen significativamente a escala: el servicio gestionado de Pinecone cuesta entre $700 y $1,200/mes por 10 millones de vectores, mientras que una infraestructura equivalente de Milvus con alojamiento propio suele costar entre $500 y $2,000/mes dependiendo de la selección de instancias, siendo la diferencia el control operativo frente a la conveniencia de cero operaciones (zero-ops). Los benchmarks de 2026 muestran a Milvus con una latencia p95 de 8 ms con aproximadamente 4,200 QPS frente a Pinecone con una latencia p95 de 12 ms con aproximadamente 2,800 QPS para cargas de trabajo de consulta comparables, lo que le da a Milvus una modesta ventaja de rendimiento a escala cuando la infraestructura está bien ajustada.
"No solo estamos combinando dos enfoques de búsqueda: estamos revolucionando la búsqueda empresarial con una solución que es 30 veces más rápida y que, al mismo tiempo, simplifica drásticamente la infraestructura." - Charles Xie, fundador y CEO de Zilliz, 17 de diciembre de 2024
Cómo es la realidad de la implementación
Milvus se distribuye en dos modos. El modo independiente (standalone) se ejecuta en Docker y es adecuado para el desarrollo y cargas de trabajo a pequeña escala. El modo clúster es nativo de Kubernetes y es la ruta recomendada para producción. La brecha entre estos dos es significativa.
Un clúster de Milvus en producción requiere, como mínimo: un clúster de Kubernetes, etcd para el almacenamiento de metadatos y almacenamiento de objetos (S3 o MinIO). Antes de Milvus 2.6, también se necesitaba Kafka o Pulsar para el registro de escritura anticipada (WAL); esa dependencia ahora es reemplazada por Woodpecker, lo cual es una simplificación significativa. El Milvus Operator (un operador de Kubernetes mantenido por Zilliz) maneja gran parte del andamiaje de implementación y la gestión del ciclo de vida. Usar Helm directamente sin el operador es posible pero frágil: los valores predeterminados no están listos para producción, y ajustar los límites de recursos, el recuento de réplicas y las clases de almacenamiento antes de que llegue una carga de trabajo real requiere experiencia tanto con Kubernetes como con bases de datos distribuidas.
Para los equipos sin esa experiencia, Zilliz Cloud elimina por completo la carga operativa. El servicio gestionado ofrece la misma superficie de API de Milvus con un nivel gratuito (5 GB, 2.5M vCUs/mes), un nivel Serverless a $4 por millón de vCUs y clústeres dedicados desde $99/mes. La plataforma Zilliz Cloud afirma tener un SLA de tiempo de actividad del 99.95% y se ejecuta en AWS, Azure y GCP. Las organizaciones que migran de OpenSearch a Zilliz Cloud han reportado reducciones de costos de hasta 8 veces mientras mantienen o mejoran el rendimiento de búsqueda, según el anuncio de lanzamiento de Zilliz de junio de 2025. La ruta gestionada es la opción realista para los equipos que desean las capacidades de Milvus sin la inversión en infraestructura.
Para quién está diseñado Milvus
Milvus es la opción natural cuando tu carga de trabajo de búsqueda vectorial es genuinamente grande. Equipos que construyen sistemas RAG que necesitan buscar a través de cientos de millones de fragmentos de documentos, motores de recomendación que indexan cientos de millones de productos o elementos multimedia, o canales de búsqueda multimodal que combinan embeddings de imágenes y texto a escala: estos son los escenarios para los que Milvus fue diseñado. Los índices acelerados por GPU benefician específicamente a los equipos que ejecutan hardware de NVIDIA en su pila de inferencia y que también necesitan el mayor rendimiento de búsqueda posible.
Los equipos de ingeniería de datos con experiencia en Kubernetes y preferencia por el control de la infraestructura de código abierto sobre la conveniencia gestionada encontrarán la arquitectura de Milvus familiar y su flexibilidad valiosa. La licencia Apache 2.0 y la gobernanza de la LF AI & Data Foundation significan que no hay dependencia del proveedor (vendor lock-in) en la capa de datos: tus embeddings son tuyos, portables entre implementaciones.
El creciente ecosistema de integración refuerza esto: Milvus funciona de forma nativa con LangChain, LlamaIndex, Haystack y LangGraph para agentes y canales RAG, y se conecta a plataformas de datos a través de conectores de Apache Spark y Kafka para flujos de trabajo de ingesta de alto volumen.
Lo que Milvus no es
Milvus no es la opción correcta para equipos en etapa inicial que necesitan que la búsqueda vectorial funcione en una tarde sin experiencia en Kubernetes. Chroma (Python integrado, cero infraestructura) o Qdrant (binario único, API REST simple) te llevan a un prototipo funcional más rápido. La sobrecarga de la arquitectura de Milvus solo se convierte en una ventaja cuando los requisitos de escala, rendimiento o flexibilidad de índices lo justifican.
No es una base de datos relacional con capacidades vectoriales añadidas. Los equipos que ejecutan principalmente consultas estructuradas con búsqueda vectorial como filtro secundario pueden encontrar a pgvector (extensión de Postgres) más ergonómico: mantiene todos los datos en un solo sistema y evita operar una base de datos separada. Milvus brilla cuando la recuperación de vectores es la operación principal, no un filtro secundario en los resultados de SQL.
Los equipos que no tienen intención de ejecutar su propia infraestructura y no necesitan las garantías de portabilidad del código abierto deberían evaluar Pinecone o Zilliz Cloud directamente. No hay razón para absorber la complejidad operativa de Milvus si el único beneficio que necesitas es un endpoint de búsqueda vectorial gestionado con autenticación simple y escalado automático.
Reseñas de usuarios
Aún no hay reseñas. ¡Sé el primero en compartir tu experiencia!
Inicia sesión para escribir una reseña.
Destacado en colecciones
Listas seleccionadas que incluyen Milvus.
Artículos relacionados
Guías y artículos relacionados con Milvus.

Mistral Medium 3.5 Self Host: 77.6% SWE-Bench on 4 GPUs (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)
