跳到主要内容
Vantaige
Together AI screenshot
Together AI logo

Together AI

付费

Together AI 是开源模型推理的首选云平台,提供 200 多种模型(包括 Llama 4 Maverick、DeepSeek-R1 和 Qwen),具备兼容 OpenAI 的 API、按 Token 计费、LoRA 与全量微调、GPU 集群租赁,以及专为智能体工作流集成的 Code Sandbox(代码沙盒)。

使用场景:代码与开发
功能:API

Together AI 是一个专为开源模型托管打造的云平台。Together Computer, Inc. 成立于 2022 年,总部位于旧金山,运营着其所谓的“AI 原生云(AI Native Cloud)”:这是一个全栈环境,用于运行推理、微调自定义模型、租赁专用 GPU 硬件以及构建智能体 AI 应用程序。在 2025 年 2 月以 $3.3 billion 的估值完成 $305 million 的 B 轮融资(由 General Catalyst 领投,NVIDIA 和 Kleiner Perkins 参投)后,Together AI 已确立其作为开源 AI 生态系统主要中立云层的地位,截至 2025 年初已服务 450,000+ 名开发者。

该平台为开发者提供 200+ 种精选开源模型的 API 访问权限,包括 Llama 4 Maverick 和 Scout、DeepSeek-R1 和 DeepSeek-V3.1、Qwen3.5、Mistral 变体、FLUX 图像模型以及用于音频的 Whisper。该 API 完全兼容 OpenAI,这意味着您只需更改一个端点即可替换 OpenAI SDK 调用。除了推理之外,Together AI 还提供 LoRA 和全参微调、专用 GPU 实例(H100、H200、B200)、按需 GPU 集群租赁,以及一个集成的 Code Sandbox 环境(于 2024 年 12 月从 CodeSandbox 收购),用于在智能体工作流中安全执行代码。

Together AI 在 2026 年 4 月的实际功能

Together AI 的核心是开源模型的 API 网关和计算层。您调用一个端点,指定一个模型,即可接收 Token。在标准无服务器(Serverless)条件下,Kimi K2.5 等优化模型的速度可达 354 tokens/second,而 Llama 3.3 70B 的速度可达 95 tokens/second。Batch Inference(批量推理)模式可将异步工作负载的成本降低 50%,每次模型运行支持高达 30 billion 个排队 Token。

微调管道接受 JSONL 数据集,并支持 LoRA(参数高效,16B 以下模型为 $0.48/1M tokens)和全量微调($1.20/1M tokens),训练后的权重可直接导出至 Hugging Face。专用推理端点允许您将单个 GPU(H100 为 $3.99/hour,H200 为 $5.49/hour,B200 为 $9.95/hour)绑定到您的自定义或托管模型,以保证吞吐量。

2024 年 12 月对 CodeSandbox 的收购增加了一项重要的新功能。Together Code Sandbox 可在 3 秒内配置隔离的虚拟机,从休眠状态恢复仅需 511 毫秒(P95),沙盒最高可扩展至 64 vCPU 和 128 GB RAM。这使得 AI 编程智能体能够安全地执行生成的代码,而不会触及生产系统。例如,HeroUI 使用 Together Code Sandbox 将 HeroUI Chat 的开发时间从 5 个月缩短至 2 周,虚拟机启动时间从 2 分钟降至 2 秒以内。

该平台还提供托管存储(零流出费用,价格为 $0.16/GiB/month)以及 GPU 集群租赁服务:按需提供 NVIDIA HGX H100($3.49/hour)、HGX H200($4.19/hour)和 HGX B200($7.49/hour),通过销售团队可获得 6 个月承诺期的预留定价。

在研究方面,Together 发表的系统研究成果获得了 ICLR、ICML、NeurIPS 和 MLSys 的认可。他们的 FlashAttention-4 研究在 NVIDIA Blackwell 上的性能比 cuDNN 快 1.3x,而其 ATLAS 运行时学习加速器在内部基准测试中实现了高达 4x 的 LLM 推理速度提升。

“我们依赖 Batch Inference API 来处理海量请求。高达 30B 排队 Token 的高频率限制让我们能够毫无瓶颈地运行大规模实验,任务始终远低于 24 小时 SLA 完成,通常只需几个小时。” - 企业用户,Together AI 博客,2025

Together AI 与 Replicate 和 Fireworks AI 的对比定位

在开源模型托管的开发者讨论中,有三个平台占据主导地位:Together AI、Replicate 和 Fireworks AI。它们在模型选择理念、API 设计、推理速度以及“超越推理”的功能方面存在实质性差异。

Replicate 运营着一个社区模型市场,拥有 50,000+ 个 Cog 打包模型,而 Together 只有 200 个精选模型。如果您需要小众研究模型、微调的 Stable Diffusion 变体或社区发布的管道,Replicate 更有可能提供。Replicate 还同时托管闭源模型(GPT-4、Claude、Gemini)和开源选项,而 Together AI 则没有。然而,Replicate 使用专有的 REST API 格式,不兼容 OpenAI,这意味着从 OpenAI 集成迁移需要更多代码更改。Replicate 按 GPU 计算秒数计费(T4 为 $0.000225/sec,A100 为 $0.001400/sec),对于文本工作负载而言,这不如 Together 的按 Token 计费可预测。在高吞吐量并发负载下,Replicate 的扩展效率也较低:一项开发者对比发现,它“随着并发请求的增加而显著变慢”,而 Together AI“在处理高吞吐量任务时扩展性更好”。Replicate 缺乏相当于 Together 的 LoRA 或全量微调工作流的生产级微调管道。

Fireworks AI 是 Together 最直接的竞争对手。Fireworks 使用定制的 FireAttention CUDA 内核,将推理速度提升至 Together 的通用 GPU 优化之上:在 TokenMix 的 2026 年第一季度基准测试中,Fireworks 在 Llama 3.3 70B 上的 TTFT P50 达到 150ms,而 Together 为 220ms;在同一模型上,吞吐量约为 145 tokens/second,而 Together 为 95 tokens/second。对于对延迟敏感的生产 API,Fireworks 具有显著的速度优势。然而,Together AI 拥有更广泛的目录(200+ 模型对比 Fireworks 的 100+),并在 LoRA 之外提供全量微调,而 Fireworks 则专注于 LoRA 和多 LoRA 服务(在同一基础模型上同时运行多个微调适配器)。Together 的 GPU 集群租赁产品(自助式 NVLink 集群,数千个 GPU)在 Fireworks 没有直接对应的产品。Llama 70B 的按 Token 定价几乎相同:Together 为 $0.88/1M tokens,而 Fireworks 为 $0.90/1M tokens。

“Together Enterprise Platform 使首个 Token 延迟降低了 2x,并将我们的成本削减了约三分之一。” - 企业用户,Together AI 案例研究,2025

实际工作流体验

对于大多数工程师来说,日常体验始于一行 API 更改。将 OpenAI SDK 中的基础 URL 指向 Together AI 的端点,设置您的 API 密钥,然后调用 Llama 4 Maverick(输入 Token 为 $0.27/1M),而不是 GPT-4o($2.50)。延迟达到生产可用水平:对于 500 个 Token 的响应,TTFT P50 约为 220ms,P95 约为 450ms。

微调需要更周密的设置。您需要准备一个 JSONL 数据集,选择一个基础模型,在 LoRA(更快、更便宜,适合大多数特定任务的适配)和全量微调(更慢、更昂贵,更适合领域转换)之间做出决定,然后通过 API 或 Web 界面提交训练任务。基础文档很扎实;但高级超参数调整的文档较为匮乏,开发者经常需要求助于论坛获取指导。训练完成后,将权重导出到 Hugging Face 非常简单。

Code Sandbox 工作流较新,主要面向智能体应用:您的 LLM 生成代码,Code Sandbox SDK 在 3 秒内配置一个隔离的虚拟机,执行代码,返回 stdout 和文件输出,然后销毁或对虚拟机进行快照。每次会话 $0.03,每 vCPU $0.0446/hour,对于 AI 编程工具来说,经济性非常合理。

工作流中较为薄弱的环节是监控。Together AI 没有提供原生的 LLMOps 仪表板。没有内置的提示词日志记录、按用户成本归因或异常警报。构建生产应用程序的团队通常会接入 LangSmith、Helicone 或 Langfuse 来填补这一空白。免费层还会遇到频率限制(60 requests/minute),这可能会让正在测试功能、尚未升级到付费计划的开发者因突然被限流而感到意外。

Together AI 的目标用户

Together AI 针对特定的用户群体:已经决定基于开源模型进行构建,并希望使用托管基础设施而不是自托管 GPU 服务器的工程师和 ML 团队。这涵盖了广泛的场景:一家用 Llama 4 替代 OpenAI 以削减 80% API 成本的初创公司,一个在专有临床数据上微调医疗特定模型的 ML 团队,一家每月通过批量推理运行 50 billion 个 Token 进行文档处理的企业,或者一家需要代码执行沙盒而无需内部构建的 AI 编程助手初创公司。

该平台也非常适合数据科学团队。用于 RAG 管道的 Embeddings、用于图像理解的视觉模型,以及用于混合文本和图像输入产品的多模态 Llama 4 Maverick,均可在同一个 API 密钥和计费账户下使用。零流出费用的存储层使得在 Together 的基础设施上存储训练数据集和模型权重变得切实可行,而不会累积数据传输成本。

Together AI 不是什么

Together AI 不是一个无代码产品。没有可视化工作流构建器,没有拖拽式模型选择器,也没有针对非技术用户的引导式入门。如果您不会编写 Python 或调用 REST API,该平台将无法为您提供价值。

它也不是一个可观测性工具。如果您需要生产级 LLMOps(成本仪表板、单次请求日志记录、延迟直方图、提示词版本管理),您需要第三方集成。Together 的原生监控非常基础,以至于几个评测网站都将其标记为一个明显的短板。

Together AI 不托管闭源专有模型。如果您的团队在评估开源选项的同时也在评估 GPT-4、Claude 和 Gemini,并希望为它们提供一个统一的 API 网关,您需要一个单独的路由层或不同的提供商。Together 完全押注于开源生态系统。

最后,对于每一寸 50 毫秒都至关重要的应用,Together AI 并不是速度最优的推理选择。如果 150ms 与 220ms 的 TTFT P50 是决定性因素,Fireworks AI 的定制推理内核在当前的基准测试中胜出。当模型广度、微调深度和基础设施范围(GPU 集群、Code Sandbox、存储)比纯粹的速度更重要时,Together 才是更好的选择。

用户评价

暂无评价,快来分享你的第一条体验吧!

登录 后即可撰写评价。

相关文章

与 Together AI 相关的指南和文章。