跳到主要内容
Vantaige
LocalAI screenshot
LocalAI logo

LocalAI

免费

LocalAI 是一款由 Ettore Di Giacinto 开发的免费开源 AI 引擎,可通过兼容 OpenAI 的即插即用 API 在本地运行任何模型。无需云端,无需 GPU,数据绝不会离开您的硬件设备。

使用场景:代码与开发
功能:APIOpen Source

LocalAI 是一款免费的自托管 AI 推理引擎,由 Ettore Di Giacinto(GitHub:mudler)开发,为您提供完全在自有硬件上运行的 OpenAI API 即插即用替代方案。该项目于 2023 年发布,采用 MIT 许可证,截至 2026 年 4 月已在 GitHub 上积累了近 46,000 颗星。其核心承诺非常直接:只需将任何支持 OpenAI API 格式的应用程序或 SDK 指向您的 LocalAI 实例,您的模型即可在本地运行,数据零外泄。无订阅费,无需 GPU,无使用限制。

LocalAI 支持 36+ 种推理后端,包括 llama.cpp、whisper.cpp、vLLM、Transformers、diffusers、Bark 和 ExLlama2。其模型格式覆盖率在自托管类别中最广:原生支持 GGUF、GGML、Safetensors、PyTorch、GPTQ 和 AWQ。除了文本之外,单个 LocalAI 实例还可以通过统一的 API 端点提供 LLM、Stable Diffusion 图像生成、Whisper 语音转录、TTS 合成、CLIP 嵌入和视频生成服务。2025 年 3 月发布的 v4.0.0 版本增加了原生智能体编排、MCP 协议支持、带有 Canvas 模式的重写 React UI 以及 WebRTC 实时音频,将 LocalAI 从一个推理服务器转变为一个完整的自托管 AI 平台。

LocalAI 在 2026 年 4 月的实际功能

在底层,LocalAI 是一个用 Go 编写的 HTTP 服务器,它将兼容 OpenAI 的 API 请求转换为针对特定模型所需后端的推理调用。通过 Docker、二进制文件或 Kubernetes 安装它,一键从模型库加载模型,您现有的 OpenAI SDK 代码无需修改即可运行,只需更改基础 URL 即可。

模型库涵盖了数百个预配置模型:Llama 3、Mixtral、Phi、Gemma、Qwen、Mistral、DeepSeek 等等,每个模型都配有现成的 YAML 配置文件,用于设置正确的后端、提示词模板、上下文窗口和量化参数。对于模型库之外的模型,您需要自己编写 YAML 配置文件,这虽然灵活,但与 Ollama 等工具相比增加了设置阻力。

截至 v4.1.3(2026 年 4 月 6 日),其功能集包括:支持函数调用和工具使用的文本生成,通过 Stable Diffusion 和 FLUX 进行图像生成,通过 Whisper 和 Moonshine 进行语音转文本,通过 Bark、Piper、Kokoro 和 Pocket-TTS 进行 TTS,用于 RAG 管道的嵌入和重排,通过 InsightFace 进行人脸识别,通过 LTX-2 进行视频生成,跨多节点的分布式集群,带有单用户配额的多用户 OIDC 身份验证,请求追踪,以及集成了 MCP 服务器的内置智能体框架(LocalAGI)。

硬件支持涵盖 NVIDIA CUDA、AMD ROCm、Apple Silicon Metal、Intel Arc、用于集成显卡的 Vulkan,以及适用于任何没有独立显卡的机器的纯 CPU 模式。Raspberry Pi 可以运行小型模型。多 GPU 服务器则可以运行大型分布式模型。

LocalAI 与 Ollama 和 vLLM 的定位对比

自托管 LLM 运行时类别由三个工具主导:LocalAI、Ollama 和 vLLM。它们不可互换,选错工具会带来真正的痛苦。

LocalAI vs. Ollama: Ollama 使用 llama.cpp 作为其唯一的推理后端,并将 GGUF 作为其主要模型格式。通过单个 CLI 命令,设置时间不到 60 秒。Ollama 原生不支持图像生成、TTS、STT 或扩散工作负载:它是一个为简单性而优化的单模态 LLM 服务器。截至 2026 年 4 月,它还缺乏流式工具调用和 tool_choice 参数。LocalAI 支持所有这些场景,外加六种模型格式(Ollama 只有一种),但需要更多的配置才能达到工作状态。社区(来自 homelab 和 r/selfhosted 领域)的评价很直接:“LocalAI 在兼容性方面很棒。Ollama 在其他方面更好。” 如果您只需要文本模型,这是准确的。如果您需要从一个端点同时使用 Whisper + Stable Diffusion + LLM,LocalAI 是唯一原生支持这三者的开源选项。

LocalAI vs. vLLM: vLLM 是一个生产级推理服务器,使用 PagedAttention(一种用于 GPU KV 缓存的虚拟内存管理系统,可消除内存碎片)。在 50+ 并发用户下,vLLM 大约达到 793 tokens/秒,而 Ollama 为 41 tokens/秒;峰值时的 P99 延迟为 80ms (vLLM) 对比 673ms (Ollama)。LocalAI 没有参与该级别的基准测试,也不是为该用例设计的。vLLM 需要专用的 NVIDIA 或 ROCm GPU、CUDA/ROCm 驱动程序、Python 环境以及解决依赖关系的耐心。它完全不支持 GGUF 模型,也没有图像、音频或视频生成能力。LocalAI 可以在 50 美元的开发板上以纯 CPU 模式运行;而 vLLM 需要 A100 才能大放异彩。它们服务于不同的需求。

“当您需要视觉或音频智能体,通过单个 YAML 在本地运行 Whisper、CLIP 和 Stable Diffusion 时,推荐使用 LocalAI。” - glukhov.org,Local LLM Hosting Complete 2025 Guide,2025 年 11 月

自托管 API 的现实情况

典型的 LocalAI 工作流从 Docker 开始。拉取镜像,使用模型目录的卷挂载运行它,Web UI 就会出现在 8080 端口上。从那里,模型库允许您一键安装精选模型:预配置的 YAML 会被放入您的模型文件夹中,并在后台开始下载。对于模型库中的模型,这几乎和 Ollama 一样顺畅。

在模型库之外,您可以通过将 YAML 文件放入模型目录来配置模型。典型的 LLM 配置指定:模型文件名、后端(例如 llama-cpp)、提示词模板(ChatML、Alpaca、Vicuna 等)、上下文窗口大小、要卸载的 GPU 层数以及默认温度。这比 Ollama 的零配置方法要做更多的工作,但它让您能够精确控制每个推理参数。图像生成模型需要类似的 YAML 配置,指向 diffusers 管道或 SD .ckpt 文件。

v4.0 React UI 增加了用于查看代码工件的 Canvas 模式、用于导入社区共享智能体的 Agenthub,以及 MCP 应用管理,以便您可以将工具服务器直接连接到聊天界面中。对于以前纯粹通过 API 运行 LocalAI 而没有 UI 的用户来说,v4.x UI 是一个实质性的升级。对于 CLI 优先的工作流,兼容 OpenAI 的 API 保持不变。

“每天都在使用。快速、可靠,而且不会监视你。” - 匿名用户评论,noizz.io,2026 年 1 月 22 日

挫折是真实存在的,并记录在 GitHub issues 中。Windows 上的 Docker 存在持续性问题:CPU 利用率不足、与 WSL 和 Docker 引擎路径不匹配相关的启动挂起,以及容器启动需要几分钟,而 Ollama 只需几秒钟。后端安装可能会在没有明确错误的情况下静默失败,导致用户拥有一个正常工作的 API 服务器,但没有推理能力。在至少一个记录详尽的 issue (#6924) 中,Docker 更新清除了保存的配置。从 Hugging Face 导入 MLX 模型曾导致实例崩溃,需要重启。这些都是可以解决的问题,但对于期望获得 Ollama 般顺畅体验的用户来说,它们是真正的摩擦点。

LocalAI 是为谁构建的

LocalAI 是三种特定情况的正确选择。首先,将本地 AI 集成到应用程序或内部工具中的开发人员,他们已经熟悉 OpenAI API,并希望在切换到本地推理时实现零代码更改。即插即用的兼容性意味着将 SDK 基础 URL 指向其他地方就是整个迁移过程。其次,homelab 和自托管基础设施操作员,他们希望通过单一服务处理 LLM、图像、音频和嵌入工作负载,而无需运行单独的 Ollama、ComfyUI 和 Whisper 服务。第三,受监管行业(医疗保健、法律、金融)中隐私优先的团队,在这些行业中,数据主权是一项硬性要求。v4.1 增加了 OIDC 身份验证和单用户配额,使得无需复杂的反向代理设置即可实现适当的多用户部署。

LocalAI 也非常适合拥有混合或较旧硬件的用户。纯 CPU 选项绝非营销噱头:Q4_K_M 级别的量化 GGUF 模型可以在配备 16GB RAM 且没有独立显卡的机器上流畅运行。Apple Silicon 用户可以从 2025 年 8 月添加的 MLX 和 llama.cpp 后端提供的 Metal 加速中受益。

LocalAI 不是什么

如果您的目标是以最少的设置与本地模型聊天,请使用 Ollama 或 LM Studio。两者都具有更顺畅的入门体验、更好的 Windows 体验以及专用的 GUI 应用程序。对于任何不构建集成的人来说,Ollama 的单命令模型拉取胜过 LocalAI 的 YAML 配置。

如果您的目标是在数百个并发用户下提供生产服务,请使用 vLLM。其 PagedAttention 架构在大规模下产生的吞吐量是任何基于 llama.cpp 的运行时的 5-20 倍,而 LocalAI 在设计上并不参与该类别的竞争。

LocalAI 还需要用户熟悉 Linux 或 macOS。它通过 WSL 或 Docker Desktop 在 Windows 上运行,但 GitHub issues 记录了足够多特定于 Windows 的摩擦,因此它不是 Windows 优先用户的推荐路径。如果您在 Windows 上运行 GUI 优先的桌面工作流,LM Studio 是更好的选择。

最后,LocalAI 不是托管服务。没有供应商支持,没有 SLA,没有托管回退。社区很活跃,GitHub issues 的响应也很及时,但如果您在周五下午遇到阻塞性错误,在维护者下次回复之前,您只能靠自己。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

收录于精选合集

包含 LocalAI 的精选合集。

相关文章

与 LocalAI 相关的指南和文章。