
Deepgram 是一款提供语音转文本 (STT)、文本转语音 (TTS) 以及语音代理编排的开发者 API。其 Nova-3 模型提供延迟低于 300 毫秒的流式转录,每音频小时仅需 0.46 美元,支持本地部署,并提供将 STT、TTS 和 LLM 路由整合在单一 WebSocket 管道中的 Voice Agent API。
Deepgram 是由成立于 2015 年的旧金山公司 Deepgram, Inc. 构建的 AI 语音平台。它提供三个生产级 API:使用 Nova-3 模型的语音转文本 (STT)、使用 Aura-2 的文本转语音 (TTS),以及将 STT、TTS 和 LLM 编排连接到单一托管 WebSocket 管道中的 Voice Agent API。该平台没有面向消费者的界面。您通过 API 发送音频或文本,即可获取结构化转录、合成语音或完整的语音代理会话。超过 450 家企业客户在生产环境中使用 Deepgram,包括 Twilio、Aircall 和 Jack in the Box。
Nova-3 于 2025 年 2 月 12 日发布,是目前的旗舰 STT 模型。它在流式音频上的中位词错率 (WER) 仅为 6.84%,比最接近的托管 API 竞争对手提升了 54.3%。它支持 10 种语言的实时语码转换 (code-switching),提供关键词提示 (keyterm prompting) 以实现无需重新训练模型的即时词汇自适应,并在流式会话中保持低于 300 毫秒的延迟。Voice Agent API 于 2025 年 6 月 16 日全面上市,在 Voice Agent Quality Index 上的基准得分为 71.5,在延迟、中断率和响应覆盖率的综合表现上优于 OpenAI 6.4%,优于 ElevenLabs 29.3%。Aura-2 TTS 提供低于 200 毫秒的首字节时间 (time-to-first-byte),涵盖 7 种语言的 40 多种英语语音。
2026 年 4 月 Deepgram 的实际功能
Deepgram 的核心产品是托管语音基础设施。您可以通过 WebSocket 连接其 API 进行实时流处理,或通过 HTTP 批量处理预录制文件。Nova-3 承担了 STT 方面的繁重工作:它接收音频流并返回带有时间戳的词级转录、可选的说话人日志 (speaker diarization)、标点符号,以及多达 50 种实体类型(电话号码、信用卡号、社会安全号码)的实时脱敏。
关键词提示功能值得特别关注。Nova-3 不需要模型微调或自定义词汇上传,而是每次 API 请求接受多达 100 个特定领域的术语,并在没有任何重新训练周期的情况下提高它们的识别概率。这使得 Deepgram 比传统的微调管道更快地适应医疗、法律或技术音频。100 个术语的上限对于大型词汇表来说确实是一个限制,但对于大多数生产用例而言,它涵盖了最高优先级的术语。
Voice Agent API 抽象了整个语音代理管道。开发人员以前必须将独立的 STT 服务、用于打断检测的 VAD 层、LLM API 和 TTS 端点拼接在一起。Deepgram 的 Voice Agent API 通过单一 WebSocket 会话处理所有这些:它管理轮流发言、中断检测、会话状态和实时提示更新。您可以在使用 Deepgram 的 STT 和 TTS 的同时自带 LLM,或者以每小时 4.50 美元的价格使用完整的 Deepgram 堆栈。
部署选项包括公有云、AWS 或 Azure 账户内的私有 VPC,以及通过 Docker 或 Kubernetes 容器进行的本地部署。本地部署路径对医疗保健和金融团队至关重要:Deepgram 的容器化架构提供与云端相同的延迟和准确性,同时将音频数据保留在企业防火墙之后。此功能仅在 Enterprise 合同中提供。
“我们测试过的最准确的实时 STT……第一个结合了实时多语言转录、实时词汇注入和低于 300 毫秒延迟的语音转文本模型。” - Stephen FIYINFOLUWA Oladele,Neurl Creators,Substack 评论,2025 年
Deepgram 与 AssemblyAI 和 Whisper 的对比定位
对于生产决策而言,最重要的比较是 Deepgram Nova-3 与 AssemblyAI Universal-2/Slam-1 以及 OpenAI Whisper 的对比。这三者涵盖了大部分开发者 STT 市场,但它们在工程权衡上有着根本的不同。
Deepgram 与 AssemblyAI:AssemblyAI 的 Slam-1 模型将 LLM 解码器与传统的 ASR 编码器相结合,这使其具有更灵活的基于提示的定制能力,并且每次请求可处理多达 1,000 个特定领域的术语,而 Nova-3 的上限为 100 个术语。AssemblyAI Universal-2 支持 100 多种语言,而 Nova-3 的多语言集较窄但更准确。AssemblyAI 还具有更深度的开箱即用音频智能:主题检测、实体检测、章节生成,以及用于对转录进行对话式查询的 LeMUR 音频 LLM。Deepgram 的音频智能(摘要、情感)更简单,并且在密集的专业技术语音上存在已知的幻觉问题。Deepgram 在原始流式延迟(低于 300 毫秒,而 AssemblyAI 为 300-600 毫秒范围)、本地部署(AssemblyAI 是纯云端 SaaS)和批量定价方面胜出。AssemblyAI Universal-2 为 0.37 美元/小时;Nova-3 在 Pay-As-You-Go 计划下为 0.46 美元/小时,但在 Growth 计划下可降至 0.39 美元/小时。
Deepgram 与 Whisper:Whisper 是 OpenAI 开源的编码器-解码器 Transformer,在 680,000 小时的多语言音频上进行了训练,其权重可用于自托管。它涵盖 57 种语言,在模型层面是免费的。但 Whisper 原生不支持实时流处理:要使其适用于实时音频,需要像 whisper.cpp 这样的变通方法,这增加了显著的工程开销。Whisper large-v3 转录一小时的音频需要 10-30 分钟(取决于硬件);而 Deepgram 转录同样一小时的音频大约只需 20 秒。在 GPU 实例(相当于 A10G 的实例通常为 0.50-1.50 美元/小时)上自托管 Whisper 会使计算成本接近 Deepgram 的 0.46 美元/小时,这使得托管与自托管之间的权衡并不像“Whisper 是免费的”这种说法所暗示的那么明确。
“我专门选择了 Deepgram,因为它宣称自己是最快的,能最大限度地减少响应延迟。” - Alyx1337,Hacker News,2023 年 12 月
语音代理管道的现实情况
Voice Agent API 是 Deepgram 最积极定位为差异化护城河的产品。在此 API 存在之前,构建语音代理意味着运行四个独立的服务:用于转录的 STT 端点、用于打断检测的 VAD 层、用于生成响应的 LLM API 以及用于朗读响应的 TTS 端点。每个环节都会增加延迟,并且在四个服务之间拼接错误状态意味着在生产环境中需要处理更多的故障模式。
Deepgram 的 Voice Agent API 将其折叠成一个单一的 WebSocket 会话。您发送音频;API 处理 VAD、STT、LLM 路由(Deepgram 的默认路由或您自己的路由)、TTS 合成以及响应音频流的返回。实时提示注入允许您在会话中途更新系统提示,模型热插拔允许在实时通话期间更改 TTS 语音。Jack in the Box 正在使用这种架构进行免下车点餐。Aircall 和 OpenPhone 正在将其集成用于呼叫处理。
然而,WebSocket 连接管理是开发人员经常遇到阻碍的地方。Deepgram 的 GitHub 讨论显示,当音频在服务器确认 SettingsApplied 消息之前开始流式传输时,会持续出现 CLIENT_MESSAGE_TIMEOUT 错误。正确的握手需要等待 Welcome,然后是 Settings,接着是 SettingsApplied 确认,然后才能发送任何音频数据。配置错误会在 2-3 秒内断开连接。修复方法已记录在案,但在快速入门指南中并未突出显示。
默认的并发流式传输配额上限为 1,200 个请求。要扩展超出此限制,需要联系 Deepgram 的销售团队,这给在生产环境中意外达到限制的快速增长团队带来了阻力。
Deepgram 适合哪些用户
Deepgram 的最佳适用对象是构建生产级语音基础设施的工程团队,对他们来说,低于 300 毫秒的延迟是硬性要求,而不仅仅是偏好。实时客户支持分析、IVR 系统、支持语音的 SaaS 功能和对话式 AI 代理都非常符合这一特征。处理数千个并发音频流的联络中心平台将受益于 Nova-3 流式架构以及针对受监管行业的本地部署选项。
200 美元的免费额度(无需信用卡)按 Pay-As-You-Go 费率计算,大约可覆盖 433 小时的 Nova-3 单语转录。对于在承诺任何计划之前评估 API 的独立开发人员和小型团队来说,这是一笔可观的探索预算。
Deepgram 不适合哪些场景
Deepgram 是一个 API。没有用于上传音频文件并获取转录结果的 Web 界面。想要在不编写代码的情况下转录播客录音或会议音频的非技术用户应该寻找其他工具:Otter.ai、Rev 和 Descript 都提供基于 UI 的转录工作流。Deepgram 专为将语音集成到应用程序中的开发人员而设计。
自定义模型微调不是自助式的。如果每次请求 100 个关键词不够用,并且您需要在自己的音频数据上训练特定领域的模型,则需要 Enterprise 合同。为 100 多种语言进行构建的团队应该转而查看 AssemblyAI 的 Universal-2。如果团队的主要需求是音频智能深度,特别是对转录的对话式查询、主题检测或实体提取,他们会发现 AssemblyAI 的 LeMUR 和 Slam-1 功能要强大得多。
如果您需要零基础设施成本的路径并且具备自托管的工程能力,请跳过 Deepgram。Whisper 的权重是免费的,在您自己的硬件上运行推理可以完全消除每分钟的费用,代价是 DevOps 开销以及从头开始构建实时流式传输支持的复杂性。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Deepgram 相关的指南和文章。

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
Build a 70-Language Live Voice Agent With GPT-Realtime-Translate (2026)

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Voice Agent for Missed Calls: Every Service Business Is Bleeding Leads After Hours (2026)
