Aller au contenu principal
Vantaige
Qdrant screenshot
Qdrant logo

Qdrant

Freemium

Qdrant est un moteur de recherche vectorielle open source développé en Rust par une équipe basée à Berlin. Il propulse des systèmes de RAG, de recherche sémantique et de recommandation en production pour des entreprises telles que Canva, HubSpot et TripAdvisor, avec une licence Apache 2.0 et un déploiement flexible, de l'ordinateur portable à l'appareil périphérique (edge).

Fonctionnalités :APIOpen Source

Qdrant est un moteur de recherche de similarité vectorielle et une base de données open source développés en Rust, créés par une équipe basée à Berlin et dirigée par le PDG Andre Zayarni et le CTO Andrey Vasnetsov. Lancé pour la première fois en 2021 sous licence Apache 2.0, il est spécialement conçu pour résoudre efficacement un problème précis : le stockage, l'indexation et l'interrogation de vecteurs d'intégration (embeddings) à haute dimension à l'échelle de la production. Ce n'est pas une base de données généraliste. Vasnetsov a décrit cette philosophie de manière directe : « l'évolutivité et les performances sont bien plus importantes que la cohérence transactionnelle, il doit donc être considéré comme un moteur de recherche plutôt que comme une base de données. » Cette orientation se reflète clairement dans son implémentation.

Ses capacités principales incluent la recherche de vecteurs denses (basée sur HNSW), la prise en charge de vecteurs creux (sparse vectors) pour la recherche par mots-clés, et une API de requête (Query API) qui combine les deux dans une recherche hybride multi-étapes côté serveur. Le filtrage de la charge utile (payload filtering) permet d'associer la similarité vectorielle à des conditions de métadonnées structurées en une seule requête. Les options de quantification (scalaire, binaire, 1,5 bit, 2 bits, asymétrique) compressent les vecteurs en mémoire sans avoir à reconstruire les index. Qdrant Cloud propose un niveau gratuit à vie sur un nœud unique, une tarification standard basée sur l'utilisation, et un modèle Hybrid Cloud où la base de données s'exécute sur l'infrastructure du client tandis que Qdrant gère les opérations. Le projet a dépassé les 250 millions de téléchargements et les 29 000 étoiles GitHub en mars 2026.

Ce que fait réellement Qdrant en avril 2026

Qdrant accepte les embeddings vectoriels accompagnés de charges utiles JSON arbitraires, construit des index HNSW (Hierarchical Navigable Small World) optimisés pour la recherche approximative des plus proches voisins, et renvoie des résultats classés et filtrés selon les conditions de la charge utile. L'API de requête introduite dans la version 1.10 permet d'enchaîner les étapes de récupération : un premier passage avec des vecteurs quantifiés trouve des candidats, un second passage les réévalue avec des vecteurs en pleine précision, et des filtres de métadonnées s'appliquent à n'importe quelle étape. Tout cela s'effectue côté serveur, ce qui signifie que votre application n'envoie qu'une seule requête au lieu de coordonner de multiples allers-retours.

Les versions récentes ont ajouté l'indexation HNSW accélérée par GPU pour une ingestion plus rapide des grandes collections, la pertinence marginale maximale (MMR) pour équilibrer la pertinence et la diversité des résultats, l'algorithme ACORN pour une recherche filtrée de meilleure qualité, et le Score-Boosting Reranking qui combine la similarité vectorielle avec des signaux métier personnalisés (récence, niveau d'utilisateur, popularité). Qdrant Edge, sorti en 2025, est une variante embarquée légère conçue pour l'IA s'exécutant sur des appareils à capacité de calcul limitée, notamment les robots, les terminaux de point de vente et les téléphones mobiles. Qdrant Cloud Inference (lancé en juillet 2025) intègre la génération d'embeddings denses, creux et d'images directement au service de recherche hébergé, éliminant ainsi le besoin d'un appel d'API d'embedding séparé.

La version auto-hébergée s'exécute sous forme de binaire unique, de conteneur Docker ou sur Kubernetes. Les collections, les instantanés (snapshots) et la configuration du cluster sont gérés via l'API REST ou gRPC. Un tableau de bord web permet de parcourir les collections et de tester les recherches de base, bien qu'il ne prenne pas en charge les opérations en masse depuis l'interface utilisateur.

Le positionnement de Qdrant face à Weaviate et Pinecone

Les trois bases de données vectorielles spécialisées les plus souvent comparées sont Qdrant, Weaviate et Pinecone. Leurs différences sont architecturales, et non cosmétiques.

Weaviate est écrit en Go et utilise une architecture modulaire où les index vectoriels, les backends de stockage et les modules de recherche sont connectables séparément. Le ramasse-miettes (garbage collector) de Go introduit des pics de latence occasionnels sous pression de la mémoire. L'implémentation en Rust de Qdrant évite totalement les pauses liées au GC, ce qui est crucial pour les applications ayant des exigences strictes en matière de latence de queue (tail latency). Weaviate met l'accent sur un modèle de stockage orienté objet avec des capacités de graphe de connaissances et une API GraphQL, ce qui en fait un meilleur choix pour les applications nécessitant une traversée de graphe relationnel en plus de la similarité vectorielle. Sa recherche hybride utilise relativeScoreFusion, qui préserve les valeurs métriques d'origine de chaque méthode de recherche. L'approche hybride de Qdrant utilise le prefetch-and-rescore (pré-récupération et réévaluation), vous permettant de spécifier exactement comment les candidats circulent entre les étapes. Les deux sont open source et prennent en charge l'auto-hébergement.

Pinecone est un logiciel propriétaire sans option d'auto-hébergement ni licence open source. Son architecture sépare le stockage du calcul au niveau de l'infrastructure, permettant une mise à l'échelle serverless jusqu'à des dizaines de milliards de vecteurs avec pratiquement aucune gestion d'infrastructure. Cette simplicité a un coût : vous ne pouvez pas exécuter Pinecone sur votre propre infrastructure, la souveraineté des données est impossible et la dépendance vis-à-vis du fournisseur (vendor lock-in) est totale. Pour les équipes soumises aux contraintes du RGPD, aux exigences de conformité des secteurs réglementés ou aux obligations de résidence des données, Pinecone n'est tout simplement pas une option. Qdrant Hybrid Cloud comble exactement cette lacune : il offre une expérience d'opérations gérées tout en conservant les données et le calcul au sein de l'infrastructure contrôlée par le client. Pinecone ne propose pas non plus de niveau auto-hébergé gratuit. Le cœur de Qdrant est sous licence Apache 2.0 et gratuit pour toujours.

« Qdrant propulse nos applications exigeantes de recommandation et de RAG. Nous l'avons choisi pour sa facilité de déploiement et ses hautes performances à grande échelle, et nous avons été constamment impressionnés par ses résultats. » - Srubin Sethu Madhavan, Technical Lead, HubSpot, qdrant.tech/blog/case-study-hubspot, 2024

À quoi ressemble réellement le flux de travail en production

Un pipeline RAG typique avec Qdrant ressemble à ceci : les documents sont découpés en morceaux (chunked), transformés en embeddings via un modèle externe (OpenAI, Cohere, Jina, ou désormais Qdrant Cloud Inference), et insérés/mis à jour (upserted) dans une collection avec des métadonnées de charge utile (ID du document, horodatage, source, ID du locataire). Au moment de la requête, l'entrée de l'utilisateur est transformée en embedding et envoyée à l'API de requête de Qdrant avec un filtre de charge utile restreignant les résultats au locataire actuel et à la plage de dates pertinente. Qdrant exécute l'étape de pré-récupération (recherche approximative rapide sur des vecteurs quantifiés), puis l'étape de réévaluation (classement en pleine précision des meilleurs candidats), et renvoie la liste classée finale à l'application, qui la transmet au LLM en tant que contexte.

Pour les équipes créant des SaaS multi-locataires sur un seul cluster Qdrant, le Tiered Multitenancy (ajouté en 2025) permet de mélanger de grands et de petits locataires dans la même collection sans dégradation des performances par locataire. Pour les systèmes de recommandation, le flux de travail est similaire mais avec des embeddings comportementaux : des vecteurs d'interaction utilisateur stockés et mis à jour de manière incrémentielle, interrogés à l'exécution par rapport aux vecteurs de contenu. TripAdvisor a mis cela en place à l'échelle de plus d'un milliard d'avis, signalant des augmentations de revenus de 2 à 3 fois supérieures pour les utilisateurs interagissant avec leur AI Trip Planner par rapport aux interfaces de recherche traditionnelles.

« Qdrant a été crucial pour notre transformation. Lorsque vous traitez plus d'un milliard de contenus multimodaux générés par les utilisateurs... » - Rahul Todkar, Head of Data and AI, TripAdvisor, qdrant.tech/blog/case-study-tripadvisor, 2024

À qui s'adresse Qdrant

Qdrant est conçu pour les ingénieurs ML et les ingénieurs backend qui ont besoin d'une couche de recherche vectorielle dédiée dans un système d'IA en production. Si vous créez des pipelines de RAG, de recherche sémantique de documents, de recommandations personnalisées, de recherche de similarité d'images ou de récupération par agents (agentic retrieval) et que vous avez besoin de performances prévisibles à faible latence à grande échelle, Qdrant est un choix par défaut solide en 2026. La licence Apache 2.0 signifie que vous pouvez l'exécuter dans n'importe quel environnement sans redevances ni restrictions contractuelles.

Les équipes d'entreprise ayant des exigences de souveraineté des données bénéficient le plus du modèle Hybrid Cloud. Les équipes de sécurité et de conformité des entreprises réglementées (santé, finance, gouvernement) peuvent déployer Qdrant au sein de leur propre VPC AWS ou de leur cluster Kubernetes sur site, tandis que l'équipe de Qdrant gère les mises à niveau de version et la surveillance opérationnelle. C'est la lacune que Pinecone ne peut structurellement pas combler.

La levée de fonds de série B de 50 millions de dollars en mars 2026 indique la direction : la recherche vectorielle composable en tant qu'infrastructure permanente, et non comme une couche temporaire destinée à être remplacée par une extension de base de données généraliste. Les investisseurs incluent AVP, Bosch Ventures, Unusual Ventures, Spark Capital et 42CAP, avec la validation de clients tels que Canva, HubSpot, Roche, OpenTable et le supercalculateur Aurora du Argonne National Laboratory.

Ce que Qdrant n'est pas

Qdrant n'est pas un remplacement direct (drop-in) pour une base de données généraliste. Il ne prend pas en charge SQL, les jointures relationnelles ou les transactions au sens traditionnel. Si votre application manipule principalement des données structurées et que vous souhaitez ajouter une recherche vectorielle de base, une extension Postgres comme pgvector peut être plus simple et suffisante. La force de Qdrant réside dans la récupération vectorielle pure à grande échelle ; si vous ne travaillez pas avec des embeddings ou la recherche de similarité, il n'y a aucune raison de l'ajouter à votre stack technique.

Qdrant ne convient pas aux équipes qui ne veulent aucune responsabilité en matière d'infrastructure. Bien que Qdrant Cloud simplifie considérablement les opérations, les déploiements en production auto-hébergés nécessitent un investissement en ingénierie : dimensionnement du cluster, planification des index de charge utile, stratégie de quantification, configuration des sauvegardes et mise en place de la surveillance. Pinecone fait véritablement abstraction de tout cela, au prix de la flexibilité et du contrôle des données.

L'interface utilisateur du tableau de bord de Qdrant est fonctionnelle mais minimaliste. Vous ne pouvez pas supprimer des collections en masse par modèle, sélectionner plusieurs collections pour des opérations, ou visualiser des espaces d'embedding sans outils externes. Les équipes qui s'appuient sur les interfaces graphiques de bases de données pour les opérations quotidiennes la trouveront limitante. L'API et la CLI sont les interfaces principales, ce qui convient aux ingénieurs mais crée des frictions pour les équipes de données sans bagage en programmation.

Les performances de filtrage peuvent se dégrader à une échelle extrême. Un problème GitHub documenté de septembre 2025 a montré une chute des requêtes par seconde (RPS) de 362 à 268 lors de requêtes de filtres de plage sur 260 millions de points. Il s'agit d'un compromis connu et Qdrant a publié des conseils d'optimisation, mais cela nécessite une conception réfléchie de l'index de charge utile dès le départ, et non après coup.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant Qdrant.

Articles associés

Guides et articles en lien avec Qdrant.