Aller au contenu principal
Vantaige
LocalAI screenshot
LocalAI logo

LocalAI

Gratuit

LocalAI est un moteur d'IA gratuit et open-source créé par Ettore Di Giacinto qui exécute n'importe quel modèle localement avec une API compatible OpenAI prête à l'emploi. Pas de cloud, pas de GPU requis, et aucune donnée ne quitte votre matériel.

Fonctionnalités :APIOpen Source

LocalAI est un moteur d'inférence d'IA gratuit et auto-hébergé, créé par Ettore Di Giacinto (GitHub : mudler), qui vous offre une alternative prête à l'emploi à l'API OpenAI s'exécutant entièrement sur votre propre matériel. Lancé en 2023 sous licence MIT, il a cumulé près de 46 000 étoiles sur GitHub en date d'avril 2026. La promesse principale est simple : pointez n'importe quelle application ou SDK utilisant le format de l'API OpenAI vers votre instance LocalAI à la place, et vos modèles s'exécutent localement sans qu'aucune donnée ne quitte votre réseau. Pas d'abonnement, pas de GPU requis, pas de limite d'utilisation.

LocalAI prend en charge plus de 36 backends d'inférence, dont llama.cpp, whisper.cpp, vLLM, Transformers, diffusers, Bark et ExLlama2. La couverture des formats de modèles est la plus large de la catégorie auto-hébergée : GGUF, GGML, Safetensors, PyTorch, GPTQ et AWQ fonctionnent tous nativement. Au-delà du texte, une seule instance LocalAI peut servir des LLM, la génération d'images Stable Diffusion, la transcription vocale Whisper, la synthèse TTS, les embeddings CLIP et la génération de vidéos à partir d'un point de terminaison d'API unifié. La version v4.0.0 de mars 2025 a ajouté l'orchestration native d'agents, la prise en charge du protocole MCP, une interface utilisateur React réécrite avec un mode Canvas et l'audio en temps réel WebRTC, transformant LocalAI d'un serveur d'inférence en une véritable plateforme d'IA auto-hébergée.

Ce que fait réellement LocalAI en avril 2026

À la base, LocalAI est un serveur HTTP écrit en Go qui traduit les requêtes d'API compatibles OpenAI en appels d'inférence vers le backend dont un modèle donné a besoin. Installez-le via Docker, un binaire ou Kubernetes, chargez un modèle depuis la galerie en un clic, et votre code SDK OpenAI existant fonctionne sans modification, simplement avec une URL de base différente.

La galerie de modèles couvre des centaines de modèles préconfigurés : Llama 3, Mixtral, Phi, Gemma, Qwen, Mistral, DeepSeek et bien d'autres, chacun avec une configuration YAML prête à l'emploi qui définit le bon backend, le modèle de prompt, la fenêtre de contexte et la quantification. Pour les modèles hors galerie, vous rédigez vous-même un fichier de configuration YAML, ce qui est flexible mais ajoute des frictions de configuration par rapport à des outils comme Ollama.

Depuis la version v4.1.3 (6 avril 2026), l'ensemble des fonctionnalités comprend : la génération de texte avec appel de fonctions et utilisation d'outils, la génération d'images via Stable Diffusion et FLUX, la conversion de la parole en texte via Whisper et Moonshine, le TTS via Bark, Piper, Kokoro et Pocket-TTS, les embeddings et le reclassement pour les pipelines RAG, la reconnaissance faciale via InsightFace, la génération de vidéos via LTX-2, le clustering distribué sur plusieurs nœuds, l'authentification OIDC multi-utilisateurs avec des quotas par utilisateur, le traçage des requêtes et un framework d'agents intégré (LocalAGI) avec intégration de serveur MCP.

La prise en charge matérielle s'étend à NVIDIA CUDA, AMD ROCm, Apple Silicon Metal, Intel Arc, Vulkan pour les GPU intégrés, et uniquement sur CPU pour toute machine sans carte graphique dédiée. Un Raspberry Pi peut exécuter de petits modèles. Un serveur multi-GPU peut en exécuter de grands modèles distribués.

Où se situe LocalAI par rapport à Ollama et vLLM

Trois outils dominent la catégorie des environnements d'exécution LLM auto-hébergés : LocalAI, Ollama et vLLM. Ils ne sont pas interchangeables, et faire le mauvais choix peut s'avérer très problématique.

LocalAI vs. Ollama : Ollama utilise llama.cpp comme unique backend d'inférence et GGUF comme format de modèle principal. La configuration prend moins de 60 secondes à partir d'une seule commande CLI. Ollama ne prend pas en charge nativement la génération d'images, le TTS, le STT ou les charges de travail de diffusion : c'est un serveur LLM monomodal optimisé pour la simplicité. Il lui manque également les appels d'outils en streaming et le paramètre tool_choice en date d'avril 2026. LocalAI prend en charge tous ces scénarios, plus six formats de modèles contre un seul pour Ollama, mais nécessite beaucoup plus de configuration pour atteindre un état fonctionnel. Le verdict de la communauté (issue des espaces homelab et r/selfhosted) est sans appel : "LocalAI était génial pour la compatibilité. Ollama est meilleur pour tout le reste." C'est exact si vous n'avez besoin que de modèles de texte. Si vous avez besoin de Whisper + Stable Diffusion + un LLM à partir d'un seul point de terminaison, LocalAI est la seule option open-source qui fait les trois nativement.

LocalAI vs. vLLM : vLLM est un serveur d'inférence de production qui utilise PagedAttention, un système de gestion de mémoire virtuelle pour le cache KV du GPU qui élimine la fragmentation de la mémoire. Avec plus de 50 utilisateurs simultanés, vLLM atteint environ 793 tokens par seconde contre 41 tokens par seconde pour Ollama ; la latence P99 en pic est de 80 ms (vLLM) contre 673 ms (Ollama). LocalAI n'est pas évalué dans cette catégorie et n'a pas été conçu pour ce cas d'usage. vLLM nécessite un GPU NVIDIA ou ROCm dédié, des pilotes CUDA/ROCm, un environnement Python et de la patience avec la résolution des dépendances. Il ne prend pas du tout en charge les modèles GGUF et n'a aucune capacité de génération d'images, d'audio ou de vidéo. LocalAI fonctionne uniquement sur CPU sur une carte à 50 $ ; vLLM a besoin d'un A100 pour briller. Ils répondent à des besoins différents.

"LocalAI est recommandé lorsque vous avez besoin d'agents visuels ou audio, en exécutant Whisper, CLIP et Stable Diffusion localement avec un seul YAML." - glukhov.org, Local LLM Hosting Complete 2025 Guide, novembre 2025

À quoi ressemble la réalité de l'API auto-hébergée

Le flux de travail typique de LocalAI commence avec Docker. Récupérez l'image, exécutez-la avec un montage de volume pour votre répertoire de modèles, et l'interface web apparaît sur le port 8080. À partir de là, la galerie de modèles vous permet d'installer des modèles sélectionnés en un clic : un YAML préconfiguré est déposé dans votre dossier de modèles et le téléchargement commence en arrière-plan. Pour les modèles de la galerie, c'est presque aussi fluide qu'Ollama.

En dehors de la galerie, vous configurez les modèles en déposant des fichiers YAML dans le répertoire des modèles. Une configuration LLM typique spécifie : le nom de fichier du modèle, le backend (par exemple llama-cpp), le modèle de prompt (ChatML, Alpaca, Vicuna, etc.), la taille de la fenêtre de contexte, les couches GPU à décharger et la température par défaut. C'est plus de travail que l'approche sans configuration d'Ollama, mais cela vous donne un contrôle précis sur chaque paramètre d'inférence. Les modèles de génération d'images nécessitent des configurations YAML similaires pointant vers un pipeline diffusers ou un fichier SD .ckpt.

L'interface utilisateur React v4.0 a ajouté un mode Canvas pour visualiser les artefacts de code, un Agenthub pour importer des agents partagés par la communauté, et la gestion des applications MCP afin que vous puissiez connecter des serveurs d'outils directement dans l'interface de chat. Pour les utilisateurs qui exécutaient auparavant LocalAI purement via l'API sans interface utilisateur, l'interface v4.x est une mise à niveau substantielle. Pour les flux de travail axés sur la CLI, l'API compatible OpenAI reste inchangée.

"Je l'utilise quotidiennement. Rapide, fiable et ne vous espionne pas." - avis d'un utilisateur anonyme, noizz.io, 22 janvier 2026

Les frustrations sont réelles et documentées dans les tickets GitHub. Docker sur Windows présente des problèmes persistants : sous-utilisation du CPU, blocages au démarrage liés à des incompatibilités de chemin entre WSL et le moteur Docker, et des conteneurs qui mettent des minutes à démarrer alors qu'Ollama démarre en quelques secondes. L'installation du backend peut échouer silencieusement sans erreur claire, laissant les utilisateurs avec un serveur d'API fonctionnel mais aucune capacité d'inférence. Les mises à jour de Docker ont effacé des configurations sauvegardées dans au moins un problème bien documenté (#6924). Les importations de modèles MLX depuis Hugging Face ont fait planter des instances nécessitant des redémarrages. Ce sont des problèmes solubles, mais ce sont de véritables points de friction pour les utilisateurs qui s'attendent à la fluidité d'Ollama.

À qui s'adresse LocalAI

LocalAI est le bon choix pour trois situations spécifiques. Premièrement, les développeurs intégrant l'IA locale dans des applications ou des outils internes qui utilisent déjà l'API OpenAI et qui ne veulent aucune modification de code lors du passage à l'inférence locale. La compatibilité prête à l'emploi signifie que pointer l'URL de base du SDK ailleurs constitue l'intégralité de la migration. Deuxièmement, les opérateurs d'infrastructures homelab et auto-hébergées qui souhaitent un service unique gérant les charges de travail LLM, image, audio et d'embedding sans exécuter des services Ollama, ComfyUI et Whisper séparés. Troisièmement, les équipes axées sur la confidentialité dans les secteurs réglementés (santé, juridique, finance) où la souveraineté des données est une exigence stricte. L'ajout dans la v4.1 de l'authentification OIDC et des quotas par utilisateur rend un déploiement multi-utilisateurs approprié réalisable sans une configuration complexe de proxy inverse.

LocalAI est également très adapté aux utilisateurs disposant de matériel mixte ou plus ancien. L'option uniquement sur CPU n'est pas une note de bas de page marketing : les modèles GGUF quantifiés en Q4_K_M s'exécutent de manière adéquate sur des machines avec 16 Go de RAM et sans GPU dédié. Les utilisateurs d'Apple Silicon bénéficient de l'accélération Metal via les backends MLX et llama.cpp ajoutés en août 2025.

Ce que LocalAI n'est pas

Si votre objectif est de discuter avec un modèle local avec une configuration minimale, utilisez Ollama ou LM Studio. Les deux offrent une prise en main plus fluide, de meilleures expériences sur Windows et des applications GUI dédiées. Le téléchargement de modèle en une commande d'Ollama surpasse la configuration YAML de LocalAI pour quiconque ne construit pas une intégration.

Si votre objectif est de servir en production des centaines d'utilisateurs simultanés, utilisez vLLM. Son architecture PagedAttention produit 5 à 20 fois le débit de n'importe quel environnement d'exécution basé sur llama.cpp à grande échelle, et LocalAI ne rivalise pas dans cette catégorie par conception.

LocalAI nécessite également d'être à l'aise avec Linux ou macOS. Il fonctionne sur Windows via WSL ou Docker Desktop, mais les tickets GitHub documentent suffisamment de frictions spécifiques à Windows pour que ce ne soit pas la voie recommandée pour les utilisateurs principalement sur Windows. Si vous exécutez un flux de travail de bureau axé sur l'interface graphique sous Windows, LM Studio est un meilleur choix.

Enfin, LocalAI n'est pas un service géré. Il n'y a pas de support fournisseur, pas de SLA, pas de solution de repli hébergée. La communauté est active et les tickets GitHub sont réactifs, mais si vous rencontrez un bug bloquant un vendredi après-midi, vous êtes livré à vous-même jusqu'à la prochaine réponse d'un mainteneur.

Avis des utilisateurs

Aucun avis pour l'instant. Soyez le premier à partager votre expérience !

Se connecter pour écrire un avis.

Présent dans les collections

Listes sélectionnées incluant LocalAI.

Articles associés

Guides et articles en lien avec LocalAI.