
Predibase 是一个基于 LoRAX 多适配器服务构建的开源大语言模型(LLM)托管微调与推理平台。它允许团队在单个 GPU 上运行数百个微调模型变体,并为无法将训练数据迁移到共享基础设施的企业提供 VPC 部署方案。
Predibase 是一个用于微调和提供开源大语言模型服务的平台,由 Uber AI 基础设施团队中创建 Horovod 和 Ludwig 的原班人马打造。该公司由 Travis Addair(首席技术官)、Devvret Rishi(首席执行官)和 Piero Molino(首席科学官)于 2021 年创立,花了三年时间构建基础设施,以解决一个特定的生产难题:如何在不为每个模型支付专用 GPU 费用的情况下,部署大量微调模型变体?2025 年 6 月,Rubrik 据报道以 1 亿美元至 5 亿美元的价格收购了 Predibase,将其定位在旨在推动企业采用代理式 AI 的数据网络安全平台中。
该平台的技术核心是 LoRAX(LoRA eXchange),这是一个开源的多适配器服务框架,可在单个 GPU 上针对共享基础模型同时运行数百个 LoRA 微调适配器。在此之上是 Turbo LoRA,这是一种将 LoRA 与投机解码(speculative decoding)相结合的技术,可在推理时实现 2-3 倍的吞吐量提升。微调通过基于 Ludwig 的训练管道进行处理,支持标准监督微调,并从 2025 年初开始支持使用 GRPO 奖励优化的强化微调(RFT)。该平台与 AWS、Azure 和 GCP 集成以实现 VPC 部署,其无服务器免费套餐每月提供高达 10M 个 token 供用户进行实验。
2026 年 5 月的 Predibase 实际功能
Predibase 作为托管控制平面运行在两个技术模块之上:用于服务的 LoRAX 和用于训练的 Ludwig。训练工作流非常直观。您只需连接数据集,选择基础模型(官方支持 Llama 3、Mistral 及其衍生模型),配置 LoRA 超参数,然后提交任务。任务在 Predibase 托管或 VPC 托管的 GPU 上运行。训练完成后,您创建一个部署端点,通过 LoRAX 将您的适配器加载到共享基础模型上。
最后一步比听起来更重要。与一些在训练完成后自动部署的竞争对手不同,Predibase 需要显式的部署创建步骤。单个 LoRAX 部署可以同时托管数十个适配器,每个适配器路由到不同的微调变体。这就是 Checkr 在多个背景调查分类任务中取代 GPT-4 时使用的架构:一个 Llama 3 8B 基础模型,多个针对不同案例类型的微调适配器,全部由一个 GPU 端点提供服务,推理速度比 OpenAI API 快 30 倍,成本降低 5 倍。
2025 年初推出并在 Enterprise 和 VPC 套餐中提供的强化微调(RFT)则更进一步。RFT 不需要数千个标记示例,而是基于奖励函数工作:您定义正确输出的标准(有效的 JSON 对象、通过的测试、高于阈值的置信度分数),模型会根据该奖励进行迭代。Predibase 的首席技术官 Travis Addair 在 2025 年 2 月的一次采访中描述了实际的限制:
“奖励函数绝对是最大的瓶颈。在使用这项技术时,你最终会把大约 80% 的时间花在这上面。”—— Travis Addair,Predibase 首席技术官,NextWord Substack,2025 年 2 月
无服务器套餐为团队提供了一条零基础设施的实验路径:每天最多 1M 个 token,每月 10M 个 token,用于 Predibase 托管的基础模型。生产工作负载则转移到按秒计费的私有部署,GPU 计算成本约为每小时 $2.14 到 $4.80,具体取决于硬件。微调任务按处理的每百万 token 收费,费率从每百万 $0.50 到 $20.00 不等,具体取决于模型大小和微调方法。
Predibase 与 OpenPipe 和 Together AI 的定位对比
微调平台在一个基本轴上产生分歧:谁提供训练数据,以及期望用户具备多少机器学习(ML)工程能力。Predibase、OpenPipe 和 Together AI 对这个问题给出了不同的答案。
OpenPipe(于 2025 年 9 月被 CoreWeave 收购)面向完全不想考虑训练数据的应用程序开发者。其 SDK 封装了您现有的 LLM API 调用,从生产流量中捕获请求/响应对,并自动将它们转换为微调数据集。您是从实时应用程序使用中进行蒸馏,而不是构建精选语料库。基础模型选择较窄(收购时大约有 10 个模型),微调方法仅限于标准 SFT。对于已经在 GPT-4 或其他托管 LLM 之上运行产品的团队来说,OpenPipe 的开销更低。对于尚未产生生产流量、正在构建全新应用程序的团队来说,它提供的帮助较少。Predibase 的 LoRAX 多适配器服务在 OpenPipe 的技术栈中没有同类替代品。
Together AI 采取广度优先的方法:通过兼容 OpenAI 的 API 提供 200 多个开源模型,微调只是其中一项功能,而非核心产品。Together 在监督微调之外还支持 DPO(直接偏好优化),而 Predibase 并未在其 UI 中原生提供该功能。Together 用于 Llama 3.1-8B 微调的上下文窗口扩展到了 131k 个 token。计费方式是按 token 而不是按 GPU 运行时间(秒)计算,这使得可变工作负载的成本更具可预测性。代价是:Together 每个端点只运行一个模型。它没有类似 LoRAX 多适配器批处理的功能,这意味着提供 20 个微调变体服务的团队需要为 20 个独立的部署付费。对于多模型集群,Predibase 的经济效益可能要好得多。对于需要一个经过良好优化且基础模型选择广泛的团队来说,Together AI 是更简洁的路径。您可以在 together.ai 了解 Together AI。
基础设施微调领域其他值得了解的平台:Modal 和 RunPod 提供原始 GPU 计算,您可以控制整个训练栈,以更高的工程成本换取更大的灵活性。Anyscale 采用原生 Ray 方法进行大规模分布式微调。Replicate 和 fal.ai 提供大规模推理服务,但提供的微调工具比 Predibase 更轻量。
微调工作流的实际情况
在 Predibase 上将微调模型投入生产涉及三个阶段:数据准备与上传、训练任务配置以及部署创建。Web UI 处理基本工作流,但暴露的超参数控制有限。高级用户可通过 Python SDK 或 REST API 进行操作。
训练数据要求遵循 Ludwig 的模式约定:列名基于任务类型命名(指令微调需要的列名与文本补全不同)。该平台在上传期间提供数据集预览窗格,在提交任务之前验证格式,从而尽早捕获模式错误。在 2024 年 6 月机器学习从业者 Alex Strick van Linschoten 的一次动手测试中,一次 Qwen2 微调运行在 A100 GPU 上大约花费了 53 分钟。训练完成后,Strick 注意到了一个摩擦点:
“我没想到会有这个额外的步骤,而且启动需要一段时间。”—— Alex Strick van Linschoten,个人博客,2024 年 6 月,指的是训练完成后的独立部署创建步骤
在他的测试中,模型部署在几个小时后未能初始化,导致无法进行推理测试。这是一种真实的故障模式,而不是边缘情况。生产团队应在路由流量之前,将验证部署初始化作为其 CI/CD 流程的一部分。当适配器从存储加载到 GPU 内存时,LoRAX 部署架构会在冷启动时引入延迟;一旦缓存,对同一适配器的后续请求就会很快。
对于 RFT 工作流,额外的复杂性在于奖励函数设计。您需要编写一个函数,该函数接收模型补全并返回标量奖励。定义明确的任务(JSON 模式验证、代码执行、正则表达式匹配)是天然的契合点。模糊任务(语气、有用性、摘要质量)需要设计评分标准,并且通常需要自定义评分逻辑。Travis Addair 观察到奖励函数设计消耗了 RFT 项目 80% 的时间,这与团队在类似 GRPO 工作流中的报告一致。Predibase 封装了基础设施,因此您无需自己管理分布式 RL 训练基础设施,但奖励设计工作并没有消失。
Predibase 适合哪些用户
最适合的是拥有专有数据、多个特定领域模型需求以及有足够计算预算来支持专用 GPU 部署的公司的机器学习工程团队。Checkr 的案例具有代表性:一个处理数百万次背景调查的生产系统,GPT-4 在边缘情况下的准确性不足,且大规模 API 成本高昂。使用特定任务适配器微调 Llama 3 8B 模型,以五分之一的成本产生了更好的准确性。Predibase 的 LoRAX 从一个部署中为所有任务适配器提供服务,而无需支付每个变体的 GPU 成本。
该平台也非常适合受监管的行业。像 Nubank 这样的金融服务公司使用 VPC 部署来确保训练数据永远不会离开其云边界。在患者记录上进行微调的医疗团队、在案件历史记录上进行微调的法律团队、处理敏感数据的政府承包商:所有这些都受益于 VPC 套餐的数据驻留保证。Rubrik 的收购加强了这一定位,将企业数据治理和安全基础设施添加到了微调工作流中。
在定制的开源 LLM 之上构建专用代理的 AI 代理开发团队是一个新兴的用例。RFT 特别适合代理奖励塑造,您可以定义代理的工具调用是否实现了目标结果,以此作为直接的奖励信号。这也是 Rubrik 在收购后推动 Predibase 发展的方向,将其从“微调平台”重新定位为“治理每个代理”的框架。
Predibase 不是什么
Predibase 不是一个无代码工具。虽然 Web UI 比从头开始构建自己的微调栈更简洁,但像 LoRA 秩选择、学习率调度和适配器合并等任务需要 ML 知识才能进行有意义的配置。没有专门 ML 工程师的团队会发现上手难度很大。
它不是一个提供无限免费推理的按 token 计费 API。无服务器免费套餐涵盖了实验需求,但生产工作负载需要按秒计费的私有部署。流量变化很大(高峰期被空闲期隔开)的团队会在空闲期间累积成本。该计费模型有利于稳定、一致的工作负载,其中 GPU 运行时间成本分摊在持续的请求上。Together AI 的按 token 计费更适合突发或季节性的使用模式。
它不是一个完整的应用程序平台。Predibase 处理训练和服务。您仍然需要在其之上构建 API 网关、请求路由、监控和应用程序逻辑。这是有意为之的:它是基础设施,而不是解决方案。
如果您的模型需求原生超出了 Llama 和 Mistral 系列,请跳过 Predibase。需要大规模微调 Qwen、Gemma、Phi-3.5 或 DeepSeek 的团队获得的官方支持有限。如果您的团队处于早期阶段,尚无生产 LLM 流量,并且希望以最快的途径获得微调模型,请跳过它,OpenPipe 的蒸馏方法能让您更快实现目标。如果收购带来的不确定性是一个阻碍因素,请跳过它:截至 2026 年 4 月,Rubrik 尚未公开详细说明 Predibase 的产品路线图,开发者社区的讨论反映出人们对自助微调产品是否仍然是网络安全公司内部的优先事项感到担忧。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Predibase 相关的指南和文章。

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Does API Cost More Than a Subscription for Claude Opus 4.8, GPT-5.5, and Grok?

Coding Ate Enterprise AI (2026): The $4B Use Case, Anthropic’s Share, and Seat vs API Math

Run Open Source AI Models Locally: Battle-Tested Guide

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives
