
Jan est une application de bureau gratuite et open-source développée par Menlo Research qui exécute de grands modèles de langage entièrement sur votre propre matériel. Pas de cloud, pas d'abonnements, aucune donnée ne quitte votre machine. Prend en charge Llama, Qwen, Mistral, Gemma et des dizaines d'autres modèles GGUF sur Windows, macOS et Linux.
Jan est une application de bureau gratuite et open-source qui exécute de grands modèles de langage localement sur votre ordinateur. Conçue par Menlo Research (une startup de R&D appliquée basée à Singapour, anciennement connue sous le nom de janhq), Jan vous permet de télécharger et d'exécuter des modèles des familles Llama, Qwen, Mistral, Gemma et DeepSeek sans aucune dépendance au cloud. C'est une véritable alternative à ChatGPT qui conserve chaque mot de chaque conversation sur votre propre matériel. Avec plus de 5,3 millions de téléchargements et 42 000 étoiles GitHub à la mi-2026, c'est l'un des clients LLM locaux les plus largement adoptés. Le projet est sous licence Apache 2.0, ce qui signifie que le code source complet est auditable, modifiable (forkable) et légalement utilisable dans des projets commerciaux sans obligations de redevances.
L'application intègre une interface de chat de type ChatGPT, un hub de modèles intégré pour télécharger des fichiers GGUF quantifiés directement depuis HuggingFace, et un serveur API local compatible OpenAI en un clic sur localhost:1337. Les développeurs peuvent pointer LangChain, AutoGen ou tout outil compatible avec le SDK OpenAI vers ce point de terminaison sans modifier leur code. Jan v0.7.7 (février 2026) a ajouté la prise en charge native de MLX pour Apple Silicon, accélérant considérablement l'inférence sur les Macs de la série M. L'application prend également en charge le Model Context Protocol (MCP) pour l'utilisation expérimentale d'outils agentiques, permettant à Jan de faire appel à la recherche web, à l'accès aux fichiers et à d'autres outils externes depuis une conversation. Les utilisateurs peuvent éventuellement connecter des fournisseurs cloud comme OpenAI, Anthropic, Mistral ou Groq via une clé API pour une configuration hybride locale et cloud.
Ce que fait réellement Jan en mai 2026
Jan v0.7.9, sortie le 23 mars 2026, est la version stable actuelle. Elle récupère une liste de modèles sélectionnés lors de l'intégration, limite automatiquement la longueur du contexte pour éviter les plantages dus à un manque de mémoire, et inclut une CLI pour les flux de travail scriptés sur Windows et macOS. L'application fonctionne sur Windows 10+, macOS 13.6+ et les principales distributions Linux, avec des exigences système commençant à 8 Go de RAM (16 Go recommandés) et plus de 10 Go de stockage pour les modèles.
Le moteur d'inférence sous le capot est llama.cpp, le même runtime C++ utilisé par LM Studio et Ollama. Pour Apple Silicon, la voie MLX (ajoutée dans la version 0.7.7) offre un gain de vitesse significatif par rapport à la voie Metal par défaut. L'accélération GPU pour les cartes NVIDIA et AMD est gérée via CUDA et ROCm. L'application Jan expose les paramètres avancés de llama.cpp (taille du contexte, température, pénalité de répétition, seed) via un panneau « Paramètres avancés » pour les utilisateurs qui souhaitent aller au-delà des réglages par défaut.
Jan propose également sa propre famille de modèles. Jan-Nano, un modèle non pensant de 4 milliards de paramètres optimisé pour les tâches de recherche approfondie avec l'utilisation de l'outil MCP, a été publié le 16 juin 2025 et est hébergé sur HuggingFace (Menlo/Jan-nano). Il s'intègre directement à l'application Jan et est conçu pour produire des rapports de recherche structurés et cités à l'aide d'outils de recherche connectés. Un guide de configuration « Jan v1 » sur le site officiel explique comment configurer le prompt système optimisé pour la recherche. Pour les utilisateurs qui souhaitent rester entièrement dans l'écosystème Jan, cette combinaison modèle-application constitue l'expérience de premier ordre prévue.
Le serveur API local mérite une mention spéciale. Lorsque vous cliquez sur « Start Server » dans l'interface de Jan, il expose un point de terminaison REST entièrement compatible avec OpenAI sur localhost:1337. Contrairement à certaines alternatives, Jan prend en charge l'exécution simultanée de plusieurs points de terminaison de modèles, ce qui signifie qu'un développeur peut configurer à la fois une instance Llama locale et un modèle distant proxyfié par OpenAI derrière la même interface et basculer entre eux sans redémarrer.
Où se situe Jan par rapport à LM Studio et Cherry Studio
L'espace des applications de bureau LLM locales compte trois concurrents sérieux en 2026 : LM Studio, Jan et Cherry Studio. Ils s'adressent à des utilisateurs très différents malgré des similitudes de surface.
Jan vs. LM Studio se résume à l'ouverture contre la finition. LM Studio est propriétaire, à code source fermé, et nécessite une licence commerciale pour un usage professionnel. Jan est sous licence Apache 2.0 : chaque ligne de code est sur GitHub, chaque dépendance est auditable, et il n'y a pas de frais de licence pour un déploiement en entreprise. Pour les organisations qui doivent vérifier la conformité (audits HIPAA, RGPD, SOC 2), la nature open-source de Jan n'est pas un simple argument, c'est une exigence pratique. Sur l'expérience utilisateur, LM Studio a une légère avance : son navigateur de modèles HuggingFace intégré permet de filtrer et de télécharger des modèles sans quitter l'application en environ 2 minutes, tandis que la découverte de modèles de Jan nécessite plus d'étapes manuelles et prend près de 5 minutes pour une première configuration. Les deux outils utilisent llama.cpp comme moteur d'inférence, de sorte que la vitesse de génération brute sur un matériel identique est à moins de 5 % l'une de l'autre. LM Studio a récemment ajouté un SDK propriétaire et une prise en charge MLX plus raffinée, lui donnant un avantage pour les développeurs qui souhaitent créer des outils spécifiques à LM Studio. L'avantage de Jan est que sa base de code ne changera jamais de licence à vos dépens.
Jan vs. Cherry Studio est une division architecturale plus fondamentale. Cherry Studio (AGPL-3.0) est principalement un agrégateur cloud : il vous offre une interface unique et soignée pour basculer entre plus de 20 fournisseurs de LLM cloud, avec une prise en charge optionnelle des modèles locaux via Ollama en tant que backend. L'identité de Cherry Studio est « une seule interface utilisateur pour toutes vos API cloud ». L'identité de Jan est à l'opposé : éliminer complètement les API cloud et tout exécuter sur votre propre machine. Cherry Studio prend en charge iOS et macOS, ce que Jan ne fait pas (pas de client mobile). Cherry Studio a légèrement plus d'étoiles GitHub (~44 900 contre ~42 400 pour Jan) et un flux de travail de changement de modèle plus actif pour les utilisateurs qui utilisent véritablement plusieurs fournisseurs cloud. Mais pour l'utilisateur dont l'exigence fondamentale est qu'aucune donnée ne quitte l'appareil, l'ADN axé sur le cloud de Cherry Studio en fait une catégorie de produit différente. Les utilisateurs évaluant Cherry Studio pour ses capacités d'IA locale devraient également envisager Open WebUI et AnythingLLM, qui offrent des interfaces d'IA locale basées sur le web avec de solides fonctionnalités de RAG et de base de connaissances.
« Cela facilite la tâche de l'utilisateur final qui ne veut pas s'embêter avec les dépendances Python et les lignes de commande ». EMM_386, Hacker News, mars 2024
Jan se positionne également différemment d'Ollama, qui est avant tout en ligne de commande (CLI) et sans interface graphique (headless). Ollama est un backend ; Jan intègre un frontend complet. De nombreux utilisateurs exécutent d'ailleurs les deux : Ollama sert les modèles à plusieurs frontends tandis que Jan agit comme client de chat de bureau. Les outils se complètent plutôt que de se concurrencer directement.
À quoi ressemble la réalité du flux de travail LLM local
L'utilisation quotidienne de Jan se divise en trois modèles. Le premier est le flux de travail d'examen de documents isolé pour des raisons de confidentialité : un professionnel de la santé, un avocat ou un analyste financier désactive sa connexion Internet, charge un modèle quantifié de 7B ou 13B paramètres (fichiers GGUF de 3 à 8 Go) et utilise l'interface de chat pour interroger ou résumer des documents qui ne peuvent pas être envoyés à un fournisseur cloud. C'est la proposition de valeur la plus claire de Jan et le scénario où aucun outil cloud ne peut rivaliser sur les garanties de confidentialité.
Le deuxième modèle est la boucle d'API locale pour les développeurs : lancer le serveur Jan sur localhost:1337, pointer une application LangChain ou Python personnalisée vers celui-ci, et itérer sur les prompts et la logique de l'agent sans accumuler de coûts d'API. Le point de terminaison compatible OpenAI de Jan signifie que le code existant qui appelle openai.chat.completions.create() ne nécessite qu'un changement d'URL de base pour s'exécuter sur un modèle local. Pour les développeurs qui créent et testent des fonctionnalités LLM, cela représente un avantage significatif en termes de coûts et de latence pendant le développement.
Le troisième est le mode assistant de recherche utilisant Jan-Nano et MCP. Configurez Jan avec un serveur MCP qui fournit un accès à la recherche web, chargez le modèle Jan-Nano 4B avec son prompt système de recherche, et demandez-lui de produire un rapport structuré sur un sujet. Jan-Nano atteint une précision de 91,1 % sur le benchmark SimpleQA, contre 78,3 % pour le modèle précédent Lucy 1.7B auquel il a succédé. Ce flux de travail produit des recherches citées et organisées plutôt que des réponses conversationnelles informelles.
« Il essaie également d'allouer 30 Go, ce qui correspond à la taille du modèle, mais ma VRAM n'est que de 10 Go et la machine de 32 Go, donc cela n'a aucun sens. Ollama fonctionne parfaitement avec des modèles de 30B. ». Utilisateur anonyme, rapport de la communauté BigGo, août 2025
Le point de friction que les utilisateurs rencontrent le plus souvent est la détection de la VRAM. Jan ne répartit pas toujours correctement le chargement du modèle entre la mémoire du CPU et du GPU comme le fait Ollama, de sorte que les utilisateurs disposant de cartes VRAM de 10 à 12 Go constatent parfois que Jan refuse de charger un modèle qui fonctionne très bien dans Ollama. Il s'agit d'un problème connu en 2025-2026 et de la plainte la plus courante sur les forums de la communauté. La version 0.7.9 a ajouté la limitation de la longueur du contexte pour réduire une catégorie de ces plantages, mais la logique d'allocation de la VRAM reste imparfaite.
Pour qui Jan est conçu
Jan est l'outil idéal pour les professionnels soucieux de la confidentialité : toute personne manipulant des documents confidentiels, des dossiers médicaux, des dossiers juridiques ou des données financières qui a besoin d'une assistance IA sans exposition au cloud. Il convient tout aussi bien aux défenseurs de l'open-source qui ont besoin d'un code auditable sous licence Apache 2.0 à des fins de conformité. Les développeurs qui souhaitent un serveur d'inférence local basé sur une interface graphique pour tester les intégrations LLM, sans gérer la CLI d'Ollama, sont également des utilisateurs naturels.
Jan n'est pas le bon choix pour les utilisateurs qui privilégient la vitesse de découverte des modèles et une expérience de première utilisation soignée : LM Studio gère l'intégration plus en douceur et son navigateur HuggingFace intégré nécessite moins d'étapes. Jan est également inadapté aux utilisateurs qui ont besoin d'exécuter plusieurs modèles simultanément, car les sessions de modèles parallèles ne sont pas entièrement prises en charge. Quiconque souhaite une interface accessible via le web plutôt qu'une application de bureau devrait plutôt se tourner vers Open WebUI ou AnythingLLM.
Jan a été nommée l'une des 20 startups open-source les plus en vogue de 2024 par le ROSS Index de TechCrunch (22 mars 2025), sur la base du taux de croissance des étoiles GitHub. Cette reconnaissance reflète une véritable dynamique communautaire : le projet a accumulé plus de 42 000 étoiles et 5,3 millions de téléchargements sans aucun niveau payant ni marketing agressif. La décision de l'équipe en juillet 2025 d'archiver Cortex.cpp et de fusionner leur travail d'inférence directement en amont dans llama.cpp était un choix délibéré pour renforcer la fondation open-source partagée plutôt que de maintenir un fork concurrent.
Ce que Jan n'est pas
Jan n'est pas un fournisseur de modèles. Il n'entraîne, n'affine ni n'héberge aucun LLM sur ses propres serveurs. Vous fournissez le matériel ; Jan fournit l'interface. Si vous recherchez un service géré qui héberge des modèles pour vous, vous devriez vous tourner vers une offre cloud comme celle d'Ollama, ou directement vers un fournisseur cloud.
Jan n'est pas un constructeur d'IA no-code. Il ne vous permet pas de déployer des chatbots pour des utilisateurs externes, de créer des flux de travail avec une interface visuelle ou de vous connecter à des applications professionnelles comme Slack ou Notion de manière native. Pour ces cas d'utilisation, AnythingLLM et des outils similaires disposent de fonctionnalités de flux de travail et de déploiement plus matures.
Jan ne fonctionne pas sur mobile. Il n'y a pas de client iOS ou Android à la mi-2026. Les utilisateurs qui souhaitent un LLM local sur un iPhone ou un iPad devront chercher ailleurs.
Enfin, l'affirmation « 100 % hors ligne » de Jan mérite une nuance. L'application établit des connexions avec GitHub et des sources externes pour les métadonnées des modèles et les vérifications de mise à jour lors d'un fonctionnement normal. Elle n'est pas isolée du réseau (air-gapped) par défaut. Les utilisateurs dans des environnements strictement isolés doivent vérifier le comportement du réseau avant le déploiement ou configurer les règles réseau en conséquence.
Avis des utilisateurs
Aucun avis pour l'instant. Soyez le premier à partager votre expérience !
Se connecter pour écrire un avis.
Présent dans les collections
Listes sélectionnées incluant Jan.
Articles associés
Guides et articles en lien avec Jan.

Run Open Source AI Models Locally: Battle-Tested Guide

Vantaige Launches the LLM VRAM Calculator: A Free GPU Compatibility Finder for Open-source and Open-Weight AI

Ship Your First MCP Server in 20 Minutes (2026)

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

AI Security Tools for Small Teams (2026): The Stack That Doesn't Need a SOC
